AWS Builder Center

"쉽게"와 "초등학생도 이해할 만큼"은 달랐다 — AI 에이전트의 질문 규칙으로 해 본 실험

AI 에이전트가 묻는 질문이 어려울 때, 질문 규칙에 "쉬운 말로"라고 적는 것과 "초등학생도 이해할 만큼"이라고 적는 것은 결과가 달랐습니다. "쉬운 말로"는 원래 규칙과 큰 차이가 없었고, "초등학생도"는 특히 "이걸 고르면 어떻게 되는지"를 더 잘 설명하게 했습니다. 정리된 자료로 질문을 쓰게 한 첫 실험에서는 말투 규칙과 질문 규칙 없이 이 한 줄만 넣어도 그 점수가 크게 올랐습니다. 하지만 AI-DLC를 실제로 실행한 두 번째 실험에서는 이 한 줄을 더해도 미리 정한 "나아졌다" 기준을 넘지 못했습니다.

AI가 묻는데, 무엇을 묻는지 모르겠다

AI 코딩 에이전트와 일하다 보면, 에이전트가 사람에게 무언가를 정해 달라고 물을 때가 있습니다. "이 기능부터 만들까요?", "데이터는 얼마나 보관할까요?" 같은 질문입니다. 그런데 질문과 선택지를 다 읽어도 무엇을 정하라는 건지 모를 때가 있습니다. 그러면 결국 "좀 더 쉽게 다시 설명해 줘"라고 되묻게 됩니다.
저는 이 문제를 AI-DLC에서 살펴봤습니다. AI-DLC(AI-Driven Development Life Cycle)는 AWS가 제안한 개발 방법입니다. AI가 계획을 세우고, 모르는 것은 사람에게 묻고, 사람이 확인해야 다음 단계로 넘어갑니다(AWS DevOps 블로그 소개 글 ). 이 방법을 여러 AI 코딩 도구에서 쓸 수 있게 만든 오픈소스가 awslabs/aidlc-workflows 입니다. 단계마다 사람이 확인해야 하니, 에이전트가 사람에게 묻는 질문이 아주 많습니다.
9월 말 무렵, 한국어 사용자들에게서 이런 피드백이 있었습니다. "질문과 선택지가 한국어로 나오는데도 무슨 뜻인지 몰라서, 쉽게 다시 설명해 달라고 해야 한다." 그때 AI-DLC는 2.10 버전대였습니다.
어려운 질문은 이런 모양입니다. 아래는 설명을 위해 만든 예시이며, 실험에서 나온 것이 아닙니다.
1
2
3
4
5
Q1. NFR-3와 §4.2의 보관 기간이 ADR-7과 충돌합니다. 어떻게 처리할까요?
A. ADR-7 유지
B. §4.2 기준으로 갱신
C. NFR-3 재정의
X. 기타
문장은 짧습니다. 하지만 NFR-3, §4.2, ADR-7이 무엇인지 알아야 답할 수 있습니다. 무엇을 정하는 질문인지, 고르면 어떻게 되는지도 나와 있지 않습니다.
사실 그때 AI-DLC에도 이 문제를 줄이려는 규칙이 있었습니다. 8월 말에 들어가 2.10 버전대에도 그대로 있던 규칙입니다. 에이전트가 질문을 쓸 때 따르는 규칙에 "질문은 그것만 읽어도 이해할 수 있어야 한다"는 문장과 세 가지 지침이 들어 있습니다.
  • 질문에 FR3, NFR-2 같은 번호를 쓸 때는, 그 번호가 가리키는 내용을 먼저 쓰고 번호는 괄호에 한 번만 적는다.
  • 왜 묻는지, 또는 답에 따라 무엇이 달라지는지 분명하지 않으면 한 줄 덧붙인다.
  • AI-DLC 안에서만 쓰는 말 대신, 사용자가 일하면서 쓰는 말로 구체적으로 묻는다.
규칙이 있었는데도 사용자들은 다시 설명해 달라고 했습니다. 세 지침을 다시 보면, 번호를 풀어 쓰고 질문 전체에 묻는 이유를 한 줄 붙이라고는 하지만, 선택지 하나하나에 고르면 어떻게 되는지를 붙이라는 지침은 없습니다.
사람에게 쉽게 설명해 달라고 할 때 우리는 흔히 "쉽게 말해 줘"라고 하거나 "초등학생도 알아듣게 말해 줘"라고 합니다. 이 두 말을 질문 규칙에 넣으면 에이전트의 질문이 어떻게 달라지는지 실험해 봤습니다.

"쉽게"와 "초등학생도"는 무엇이 다른가

비교한 지시는 두 가지입니다. AI-DLC의 규칙은 영어로 쓰여 있어서, 실험에서도 영어 문장을 넣었습니다.
이름앞부분 (서로 다름)뒷부분 (똑같음)
"쉬운 말로"Write every question and choice in plain everyday words, as if the person had asked you to explain it so someone new could understandsay first what needs deciding and why, and what each choice leads to. Keep an exact name only where the answer depends on it.
"초등학생도"Write every question and choice so simply that an elementary school student could understand it(위와 같음)
두 지시의 뒷부분은 글자 하나까지 같습니다. 뜻은 이렇습니다. "무엇을 왜 정해야 하는지, 각 선택을 고르면 어떻게 되는지를 먼저 말하라. 정확한 이름은 답에 꼭 필요할 때만 남겨라."
다른 것은 앞부분 하나입니다. 누구를 기준으로 쉽게 쓰라고 하느냐입니다. 하나는 "쉬운 일상어로, 처음 보는 사람에게 설명하듯"이고, 다른 하나는 "초등학생도 이해할 만큼"입니다.
여기서 '초등학생'은 지시에 쓴 말일 뿐입니다. 초등학생에게 질문을 읽혀 본 실험은 아닙니다.

실험 1: 두 지시를 나란히 비교하기 (2026년 9월 29일)

어떻게 했나

실제 AI-DLC 작업 두 건(이 글에서는 사례 A, 사례 B라고 부릅니다)에서 질문 네 개를 골랐습니다. 질문마다, 그 질문을 쓰는 데 필요한 사실을 정리한 자료를 만들었습니다. 그리고 Claude에게 질문 규칙과 이 자료를 주고, 그 질문을 한국어로 새로 쓰게 했습니다. 조건마다 같은 질문을 세 번씩 쓰게 했습니다. 질문 규칙은 피드백이 나온 그 무렵, 2.10 버전대의 것을 썼습니다.
점수도 Claude가 매겼습니다. 어느 조건에서 나온 질문인지는 알려 주지 않았습니다. 순서를 섞은 묶음 두 가지를 만들어 각각 한 번씩 점수를 매겼습니다. 점수는 세 가지입니다.
  • 결정 점수: 무엇을 정해야 하는지 알겠는가 (1~5점)
  • 결과 점수: 고르면 어떻게 되는지 알겠는가 (1~5점)
  • 모를 만한 용어: 읽는 사람이 모를 만한 말이 몇 개인가 (점수를 매긴 AI가 센 개수)
조건마다 점수는 24번 매겼습니다. 질문 4개 × 세 번 쓰기 × 두 번 채점입니다. 사람 24명이 읽은 것도, 서로 다른 질문 24개도 아닙니다.

결과: "쉬운 말로"는 거의 그대로, "초등학생도"는 달라졌다

세 조건을 같은 채점 묶음에서 비교했습니다. 원래 규칙만 쓴 조건, 원래 규칙에 "쉬운 말로" 줄을 더한 조건, 원래 규칙에 "초등학생도" 줄을 더한 조건입니다. 표의 점수는 "결정 / 결과" 순서입니다.
질문원래 규칙+ "쉬운 말로"+ "초등학생도"
사례 A, 요구사항 정하기4.17 / 4.174.33 / 4.004.17 / 4.17
사례 A, 팀 작업 방식4.67 / 3.674.67 / 3.835.00 / 4.33
사례 B, 승인과 넘겨주기3.67 / 4.004.00 / 4.004.33 / 4.67
사례 B, 팀 작업 방식4.17 / 4.174.00 / 4.004.83 / 4.83
평균 (조건마다 24번)4.17 / 4.004.25 / 3.964.58 / 4.50
모를 만한 용어 (평균 개수)1.251.461.42
"쉬운 말로"는 원래 규칙과 거의 구별되지 않았습니다. 결과 점수는 오히려 조금 낮았습니다. "초등학생도"는 질문 네 개 가운데 세 개에서 가장 높았고, 나머지 하나는 원래 규칙과 같았습니다. 모를 만한 용어의 수는 세 조건이 거의 같았습니다.
같은 날 다른 시험도 하나 했습니다. AI-DLC는 질문을 먼저 파일에 써 둡니다. 사람이 "하나씩 안내해 달라"를 고르면, 그 질문을 채팅 화면에 하나씩 보여 줍니다. 이 시험에서는 실제 작업에서 나온 질문 파일의 질문 세 개를, 조건마다 채팅 화면에 어떻게 보여 주는지 비교했습니다. 점수는 매기지 않고, 나온 글만 나란히 봤습니다.
  • 원래 규칙만 있을 때: 에이전트가 파일에 적힌 질문을 거의 그대로 옮겨 보여 줬습니다.
  • "쉬운 말로" 줄이나 "초등학생도" 줄을 넣었을 때: 둘 다 질문을 다시 써서, 무엇을 정해야 하는지를 먼저 말했습니다. 길이도 4분의 1쯤 짧아졌습니다.
  • 그중 선택지마다 "이걸 고르면 어떻게 되는지"를 덧붙인 경우는 "초등학생도" 쪽이 가장 많았습니다.

다른 규칙이 하나도 없으면

이 한 줄이 원래 규칙의 도움 없이도 효과가 있는지 보려고, 규칙을 넣고 빼 가며 다시 비교했습니다. 여기서 규칙은 두 가지입니다.
  • 말투 규칙: 에이전트가 사람에게 하는 모든 말에 적용되는 규칙입니다.
  • 원래 질문 규칙: 앞에서 소개한 "질문은 그것만 읽어도 이해할 수 있어야 한다"는 문장과 세 가지 지침입니다.
표의 "질문 규칙을 줄로 바꿈"은 원래 질문 규칙을 빼고 그 자리에 "초등학생도" 줄을 넣었다는 뜻입니다. 어느 조건이든 사실 자료와 "질문을 써라"는 과제는 똑같이 줬습니다.
조건말투 규칙원래 질문 규칙넣은 줄결정결과모를 만한 용어
규칙 없음–––4.254.041.50
원래 규칙✓✓–4.384.001.00
원래 규칙 + "쉬운 말로"✓✓"쉬운 말로"4.384.251.17
원래 규칙 + "초등학생도"✓✓"초등학생도"4.584.461.17
질문 규칙을 줄로 바꿈✓–"초등학생도"4.624.711.00
"초등학생도" 줄만––"초등학생도"4.624.711.12
질문 규칙을 줄로 바꿈 + 번호 풀이 지침만 남김✓번호 풀이 지침만"초등학생도"4.884.580.96
(조건마다 24번. 같은 조건이라도 채점 묶음이 바뀌면 평균이 0.1~0.2점쯤 움직였습니다. 그래서 앞의 표와 이 표의 숫자를 직접 비교하지는 않습니다.)
눈여겨볼 줄은 규칙 없음과 "초등학생도" 줄만입니다. 말투 규칙도 질문 규칙도 없이 이 한 줄만 넣었더니, 결과 점수가 4.04에서 4.71로 올랐습니다. 원래 규칙(4.00)보다도 높습니다.
이 표 전에 조건 여섯 개로 따로 채점한 적도 있는데, 그때도 같았습니다. 규칙 없음은 4.12 / 4.04, "초등학생도" 줄만은 4.67 / 4.71이었습니다. 두 번 모두 결과 점수가 약 0.67점 올랐습니다. 채점 묶음이 바뀔 때 생기는 흔들림(0.1~0.2점)보다 훨씬 큰 차이입니다.
같은 표에서 "쉬운 말로"도 원래 규칙보다 결과 점수가 조금 올랐습니다(4.00 → 4.25). 하지만 "초등학생도"(4.46)에는 못 미쳤습니다. "쉬운 말로" 줄만 넣고 다른 규칙은 뺀 조건은 시험하지 않았습니다.

실제 작업 자료를 넣으면

앞의 비교에는 약점이 하나 있었습니다. 질문에 필요한 사실만 골라 깔끔하게 정리해서 줬다는 점입니다. 정리한 자료에는 설명 없는 번호가 거의 없었습니다. 그래서 실제 작업에서 문제였던 설명 없는 번호를 이 지시가 줄이는지는 제대로 볼 수 없었습니다.
실제로 일할 때는 다릅니다. 에이전트는 앞 단계에서 만든 문서, 정해 둔 내용의 목록, 코드를 살펴본 결과 같은 자료를 잔뜩 읽은 뒤에 질문을 씁니다. 이런 자료에는 FR3, §4.2 같은 번호가 가득합니다.
그래서 이번에는 실제 작업 자료를 정리하지 않고 그대로 넣어 봤습니다.
  • 넣은 것: 사례 A와 사례 B의 실제 작업 자료, 각각 300KB쯤(문서 여러 개 분량)
  • 쓰게 한 것: 질문 하나가 아니라, 한 단계의 질문 파일 전체
  • 비교한 것: 원래 규칙과, 앞 표의 마지막 조건(질문 규칙을 "초등학생도" 줄로 바꾸고 번호 풀이 지침만 남김)
  • 쓴 AI: 질문 쓰기와 채점 모두 Claude Opus 4.6
점수: 사례 A에서 바꾼 규칙의 결정·결과 점수는 4.33 / 4.25였습니다. 원래 규칙(4.17 / 4.17)보다 낮지 않았습니다. 사례 B는 점수를 매기지 못했습니다. 채점하는 AI가 답을 내기 전에 출력 한도에 걸렸기 때문입니다.
설명 없는 번호: 설명 없이 쓰인 번호나 이름은 프로그램으로 셌습니다. 질문 하나에 평균 몇 개가 있었는지는 이렇습니다.
사례원래 규칙바꾼 규칙
사례 A4.22개4.07개 (거의 그대로)
사례 B2.86개1.41개 (절반쯤으로 줄어듦)
에이전트가 읽은 자료에서 들어온 번호는, 이 한 줄로 줄어들 때도 있었지만 그대로일 때도 있었습니다.

왜 "초등학생도"가 달랐을까

두 지시는 뒷부분이 같습니다. "결과를 먼저 말하라"는 요구는 둘 다 똑같이 받았다는 뜻입니다. 그런데도 결과가 달랐다면, 차이는 앞부분, 즉 누구를 기준으로 삼느냐에서 나왔다고 볼 수 있습니다. 아래는 결과를 보고 제가 해석한 것이고, 따로 확인한 것은 아닙니다.
  • "처음 보는 사람"은 넓은 기준입니다. "쉬운 말로" 지시에도 "처음 보는 사람이 이해하도록"이라는 독자가 들어 있습니다. 하지만 그 사람이 무엇을 모르는지는 분명하지 않습니다. 그래서 에이전트가 "내 글은 이미 이 정도면 쉽다"고 여기면 고칠 이유가 없습니다. "쉬운 말로"를 넣어도 원래 규칙과 큰 차이가 없었던 것과 맞습니다.
  • "초등학생"은 구체적이고 낮은 기준입니다. 개발 용어도, 프로젝트 사정도 모르는 독자를 떠올리게 합니다. 그러면 무엇을 왜 정하는지, 고르면 어떻게 되는지를 실제로 풀어 써야 합니다. 같은 뒷부분 요구도 "초등학생도"와 함께일 때 결과 점수를 더 올렸고, 선택지마다 결과를 붙인 경우도 가장 많았습니다.
정리하면, 제가 본 차이는 기준이 되는 독자를 얼마나 구체적이고 낮게 잡았느냐였습니다.
실험 1에서 원래 규칙으로 쓴 질문과 "초등학생도"로 쓴 질문을 제가 직접 나란히 읽어 봐도, "초등학생도" 쪽이 읽기 편했습니다. 다만 이것은 저 한 사람의 느낌이고, 기준을 정해 점수를 매긴 것이 아닙니다. 그래서 앞의 점수를 뒷받침하는 근거로 쓰지는 않습니다.

실험 2: AI-DLC를 실제로 실행해서 (2026년 10월 9일)

실험 1에서는 정리된 자료로 질문을 쓰게 했고, 뒤에 한 비교에서는 실제 작업 자료도 넣었습니다. 하지만 AI-DLC를 직접 돌린 것은 아니었습니다. 실제로 일할 때는 에이전트가 AI-DLC의 여러 지침과 앞 단계에서 만든 문서를 바탕으로, 단계마다 질문 파일을 씁니다. 그 상황에서도 "초등학생도" 줄이 차이를 내는지 보려고, 이번에는 AI-DLC를 실제로 실행해 질문을 모았습니다.
실험에는 10월 8일에 나온 AI-DLC 2.11.0 을 썼습니다. "질문은 그것만 읽어도 이해할 수 있어야 한다"는 문장과 세 가지 지침은, 실험 1 때(2.10 버전대)와 글자 하나까지 같았습니다. 그사이 바뀐 것은 다른 곳입니다. 작업이 막혔을 때 묻는 질문과 선택지, 사람이 읽는 안내 문구, 질문과 관련된 일부 지침이 쉬운 말로 고쳐졌습니다(#1976 , #2024 , #2010 , #2069 ).
2.11.0을 써 보니, "초등학생도" 줄이 없어도 질문이 전보다 그렇게 어렵지 않다고 느꼈습니다. 그래서 이 상태에서도 "초등학생도" 줄을 넣으면 질문이 더 나아질지 궁금했습니다.
실험 2에는 "쉬운 말로"를 넣지 않았습니다. 실험 1에서 이미 "초등학생도"가 "쉬운 말로"보다 나았기 때문입니다. 이번에는 실제로 실행하는 상황에서도 "초등학생도"가 계속 좋은 결과를 내는지에 집중했습니다.

어떻게 했나

Kiro CLI(2.28.0)에서 Claude Opus 4.8로 AI-DLC 2.11.0을 실행했습니다.
먼저 원래 규칙 그대로 작업을 두 번 진행했습니다. 만들기에 들어가기 전, 요구사항과 설계를 정하는 앞 단계(Inception)까지입니다. 하나는 설명용으로 만든 식당 테이블 주문 앱이고, 다른 하나는 요구사항 번호를 일부러 많이 쓴 가상의 좌석 예약 앱입니다. 두 작업에서 각각, 질문을 만드는 여섯 단계의 바로 앞 상태를 저장해 두었습니다. 이렇게 저장한 상태 12개를 "출발 상태"라고 부르겠습니다.
네 조건 모두 "질문은 그것만 읽어도 이해할 수 있어야 한다"는 문장과 첫째 지침(번호 풀이)은 남겼습니다. 다르게 한 것은 둘째 지침(왜 묻는지 한 줄), 셋째 지침(사용자가 쓰는 말로 구체적으로), 그리고 "초등학생도" 줄입니다.
"초등학생도" 줄에도 이 두 지침과 비슷한 말이 있습니다. "무엇을 왜 정하는지 먼저 말하라"는 둘째 지침과, "초등학생도 이해할 만큼 쉽게"는 셋째 지침과 비슷합니다. 여기에 원래 규칙에 없던 "각 선택의 결과"도 들어 있습니다. 줄을 더하는 효과와 두 지침을 빼는 효과를 나눠 보려고, 아래 네 조건을 비교했습니다.
  • 원래 규칙: 세 지침 그대로
  • 덧붙이기: 세 지침 + "초등학생도" 줄
  • 빼기만: 둘째·셋째 지침을 빼고, 줄은 넣지 않음
  • 바꿔 넣기: 둘째·셋째 지침 자리에 "초등학생도" 줄
바꿔 넣기는 실험 1의 마지막 조건(질문 규칙을 줄로 바꾸고 번호 풀이 지침만 남김)과 비슷한 모양입니다. 다만 이번에는 "질문은 그것만 읽어도 이해할 수 있어야 한다"는 문장도 남겼습니다.
출발 상태마다 네 조건으로 새로 시작해서, 그 단계의 질문 파일을 사람이 답하기 전에 저장했습니다. 조건마다 두 번씩 만들어, 모두 96개 파일을 모았습니다.
점수는 Codex CLI를 통해 OpenAI 모델 하나가 매겼습니다. 출발 상태마다 파일 8개를 어느 조건인지 모르게 하고 두 번씩 채점했습니다. 선택지에 붙은 "(추천)" 같은 표시는 지우고 질문만 넘겼습니다. 그리고 처음 진행한 작업의 질문 파일을 기준으로 삼아, 거기서 정하도록 한 내용을 새 질문 파일도 얼마나 빠짐없이 묻는지 봤습니다. 이 비율을 "정할 내용 보존율"이라고 부르겠습니다.

무엇을 "나아졌다"고 볼지 미리 정했다

결과를 보기 전에 기준부터 정했습니다.
기준점은 0.2점입니다. 실험 1에서 같은 질문을 다른 채점 묶음에서 다시 채점하면 평균이 0.1~0.2점쯤 움직였습니다. 그래서 0.2점보다 작은 차이는 채점하는 AI의 흔들림과 구별하기 어렵다고 봤습니다.
"나아졌다"는 결과 점수 하나로만 판단했습니다. 실험 1에서 "초등학생도"가 주로 바꾼 것이 결과 점수였기 때문입니다. 점수를 여러 개 두고 그중 하나만 넘어도 된다고 하면, 우연히 넘은 점수를 고르게 될 수 있어서이기도 합니다.
또 평균 차이가 얼마나 믿을 만한지 보려고 "95% 범위"를 계산했습니다. 저장한 출발 상태 12개에서 중복을 허용해 12개씩 다시 뽑고, 평균 차이를 계산하는 일을 1만 번 되풀이해서 얻은 범위입니다. 실험을 1만 번 다시 한 것은 아닙니다. 범위가 넓을수록 평균 차이가 얼마인지 더 불확실하고, 범위에 0이 들어 있으면 차이가 없을 수도 있다는 뜻입니다.
  • 나아졌다: 결과 점수가 원래 규칙보다 0.2점 이상 높고, 95% 범위 전체가 0보다 위일 때.
  • 나빠지지 않았다: 점수가 전혀 안 떨어졌다는 뜻이 아닙니다. 원래 규칙과 비교한 차이의 95% 범위에서, 가장 낮은 값이 세 가지를 모두 만족할 때입니다. 결정 점수와 결과 점수는 각각 −0.2점보다 높고, 정할 내용 보존율은 −10%p보다 높아야 합니다. %p는 비율끼리 뺀 차이입니다. 84%가 81%가 되면 −3%p입니다. 단계마다 정할 내용은 평균 6개쯤이어서, 10%p는 정할 내용 하나의 절반 남짓입니다.
출발 상태가 12개뿐이라, 아주 작은 차이는 결론을 내리지 않았습니다.

결과: 덧붙여도 "나아졌다" 기준을 넘지 못했다

조건 평균 (출발 상태 12개)결정결과모를 만한 용어 (질문당 평균 개수)정할 내용 보존율
원래 규칙4.284.031.6384%
덧붙이기4.444.091.3485%
빼기만4.253.971.5783%
바꿔 넣기4.454.081.1781%
원래 규칙과의 차이 [95% 범위]결정 (점)결과 (점)정할 내용 보존율 (%p)
바꿔 넣기+0.17 [+0.01, +0.36]+0.05 [−0.17, +0.28]−3%p [−7, +1]
덧붙이기+0.16 [−0.01, +0.34]+0.05 [−0.13, +0.22]+1%p [−6, +7]
빼기만−0.02 [−0.15, +0.11]−0.07 [−0.28, +0.12]−1%p [−4, +3]
실험 1에서 "초등학생도"가 크게 올렸던 결과 점수가, 이번에는 덧붙여도 바꿔 넣어도 평균 +0.05점에 그쳤습니다. 미리 정한 "나아졌다" 기준을 넘지 못했습니다.
덧붙이기의 결정 점수는 평균 +0.16점 올랐습니다. 하지만 95% 범위가 0을 포함해서(−0.01~+0.34), 결정 점수가 높아졌다고 확정할 수는 없었습니다.
바꿔 넣기는 두 앱의 결과를 합쳐서 볼 때만 "나빠지지 않았다" 기준을 넘었습니다. 앱별로 나눠 보면 그것도 따로 확인되지 않았습니다.
실험 2에서 나온 글을 제가 읽어 봐도 큰 변화는 느껴지지 않았습니다.
두 실험은 여러 가지가 달랐습니다. 실험 1의 주된 비교는 정리된 자료로 질문 하나를 쓰는 일이었고, 실험 2는 실제 작업 속에서 한 단계의 질문 파일 전체를 쓰는 일이었습니다. 점수를 매긴 AI(Claude와 OpenAI 모델)도, AI-DLC 버전(2.10 버전대와 2.11.0)도 달랐습니다. 그리고 실험 2에는 "규칙 없음" 조건이 없었습니다. 그래서 무엇 때문에 결과가 달라졌는지는 알 수 없습니다.

그래서: 자세한 지침이 없다면 좋은 출발점

두 실험을 합쳐 보면 이렇습니다.
  • 말투 규칙도 질문 규칙도 없을 때, "초등학생도" 한 줄만으로 결과 점수가 원래 규칙보다 높아졌습니다 (실험 1).
  • 뒷부분이 똑같은 지시인데도, "쉬운 말로"보다 "초등학생도"가 "고르면 어떻게 되는지"를 더 잘 설명하게 했습니다 (실험 1).
  • AI-DLC를 실제로 실행했을 때는, 덧붙여도 결과 점수가 미리 정한 "나아졌다" 기준을 넘지 못했습니다 (실험 2).
그래서 자세한 응답 지침 없이 에이전트를 쓰고 있다면, "쉽게 말해 줘"보다 "초등학생도 이해할 만큼"으로 시작해 보는 것이 좋은 출발점이 될 수 있습니다. 이것은 정리된 자료로 질문을 쓰게 한 작은 실험(실험 1)의 두 결과를 합쳐서 내린 판단입니다. 다른 규칙 없이 "쉬운 말로" 줄만 넣은 조건은 시험하지 않았습니다. 그리고 AI-DLC를 실제로 실행한 실험 2에서는, 덧붙였을 때 나아지는 것을 다시 확인하지 못했습니다. 이미 쓰는 지침이 있다면, 한 줄을 더한 뒤 실제 질문이 달라지는지 직접 확인해 보세요.

직접 써 보려면

실험에 쓴 영어 문장은 이렇습니다.
Write every question and choice so simply that an elementary school student could understand it: say first what needs deciding and why, and what each choice leads to. Keep an exact name only where the answer depends on it.
우리말로 옮기면 "질문과 선택지를 초등학생도 이해할 만큼 쉽게 쓴다. 무엇을 왜 정하는지와 각 선택의 결과를 먼저 말한다. 정확한 이름은 답에 꼭 필요할 때만 남긴다."입니다. 실험에서는 영어 문장을 넣고 한국어 질문을 받았습니다. 이 우리말 문장 자체로는 시험하지 않았습니다.
써 볼 때는 두 가지를 함께 보세요.
  • "고르면 어떻게 되는지"가 붙었나: 실험 1에서 가장 크게 달라진 것이 이것이었습니다. 선택지마다 이 설명이 붙는지 확인해 보세요.
  • 낯선 번호가 남았나: 에이전트가 읽은 문서의 번호는 이 한 줄로도 사라지지 않았습니다. 번호가 남는다면, 문장보다 에이전트에게 주는 자료 쪽을 살펴봐야 할 수 있습니다.
아래는 이 지시가 노리는 질문 모양을 보여 주려고 설명을 위해 따로 만든 예시입니다. 실험에서 나온 것도 아니고, 앞의 어려운 질문을 고친 것도 아닙니다.
1
2
3
4
5
Q1. 회원이 탈퇴하면 그 사람의 주문 기록을 언제 지울지 정해야 합니다.
문서마다 적힌 기간이 달라서, 이걸 정해야 삭제 기능을 만들 수 있습니다.
A. 탈퇴하면 바로 지운다 — 개인 정보는 빨리 사라지지만, 나중에 환불 문의가 오면 확인할 기록이 없습니다.
B. 1년 보관한 뒤 지운다 — 환불·분쟁에 대응할 수 있지만, 보관하는 동안 개인 정보를 안전하게 관리해야 합니다.
X. 기타 (직접 적어 주세요)

이 실험으로 알 수 없는 것

사람에게 읽혀 이해도를 확인하지는 않았습니다. 질문을 쓴 것도, 점수를 매긴 것도 AI입니다. 제가 결과를 읽어 본 느낌 말고는 사람의 평가가 없습니다. 실험 1은 Claude가, 실험 2는 Codex CLI를 통해 OpenAI 모델 하나가 채점했습니다. 채점할 때 어느 조건인지 숨기고 순서를 섞었을 뿐입니다. 초등학생이나 실제 사용자에게 읽혀 본 것도 아닙니다.
한 가지 일만, 작게 해 봤습니다. 두 실험 모두 AI-DLC에서 질문을 쓰는 일이었습니다. 설명, 요약, 오류 안내 같은 다른 글에서도 같은 차이가 나는지는 모릅니다. 실험 1의 사실 자료 비교는 질문 네 개였고, 실험 2는 앱 두 개에서 나온 출발 상태 12개였습니다. 모두 한국어였습니다. 여러 AI 모델을 비교한 실험도 아닙니다. 실험 1에서 사실 자료로 질문을 쓴 모델은 확인할 수 없습니다. 실제 작업 자료를 넣은 비교에는 Opus 4.6을, 실험 2에는 Opus 4.8을 썼습니다.
"지침이 없을 때"의 근거는 실험 1에만 있습니다. 규칙 없음(말투 규칙과 질문 규칙이 모두 없는 조건)과 "초등학생도" 줄만의 비교는, 정리된 자료로 질문을 쓰게 한 실험 1에서 나왔습니다. 실제로 실행하면서 지침 없이 시험한 결과는 없습니다. "쉬운 말로" 줄만 넣은 조건도 시험하지 않았습니다.
"초등학생도"가 왜 다른지는 제 해석입니다. 넓은 기준과 구체적인 기준이라는 설명은 결과와 맞지만, 그 설명 자체를 확인하는 실험은 하지 않았습니다.

정리

  1. "쉽게"와 "초등학생도"는 달랐습니다. 뒷부분이 똑같은 두 지시 가운데 "쉬운 말로"는 원래 규칙과 큰 차이가 없었고, "초등학생도"는 특히 "고르면 어떻게 되는지"를 더 잘 설명하게 했습니다. 기준이 되는 독자를 구체적이고 낮게 잡아 주기 때문으로 보입니다.
  2. 다른 규칙이 없을 때는 이 한 줄이 큰 차이를 냈습니다. 정리된 자료로 질문을 쓰게 한 실험 1에서, 말투 규칙과 질문 규칙 없이 이 줄만 넣었더니 결과 점수가 원래 규칙보다 높아졌습니다.
  3. AI-DLC를 실제로 실행한 실험 2에서는 나아지는 것을 다시 확인하지 못했습니다. 덧붙여도 결과 점수가 미리 정한 "나아졌다" 기준을 넘지 못했고, 바꿔 넣기는 두 앱의 결과를 합쳐서 볼 때만 "나빠지지 않았다" 기준을 넘었습니다. 실험 1과 결과가 왜 달랐는지는 알 수 없습니다.
자세한 응답 지침 없이 에이전트에게 질문을 받고 있다면, 위에 소개한 "초등학생도" 한 줄 지시부터 넣어 보세요. 그리고 선택지마다 "고르면 어떻게 되는지"가 붙는지, 낯선 번호가 남는지를 함께 확인해 보시길 권합니다.

참고 자료

Any opinions in this article are those of the individual author and may not reflect the opinions of AWS.
Enjoyed reading this content? Let the author know!

Your likes, comments, shares, and saves help creators reach more builders.

Loading recommendations

Loading article