AI에게 “다시 잘 써 달라”고 하면 충분할까
2026-09-08
Self-Refine에서 AI 하네스로
AI가 만든 첫 번째 결과물이 마음에 들지 않을 때 우리는 흔히 이렇게 말합니다.
“조금 더 잘 써 주세요.”
“다시 검토해 주세요.”
그러나 무엇이 부족한지, 어떤 기준을 충족해야 하는지 알려 주지 않으면 두 번째 결과물도 표현만 달라질 뿐 품질은 크게 나아지지 않을 수 있습니다.
제가 AI 생성물의 품질을 높이기 위해 자주 활용하는 방법 중 하나가 Self-Refine, 즉 자가 피드백과 자가 교정입니다.
Self-Refine이란 무엇인가
Self-Refine은 AI가 만든 1차 결과물을 스스로 평가하고, 그 피드백을 반영하여 결과물을 다시 개선하는 방식입니다.
구조는 단순합니다.
초안 생성 → 자가 평가 → 개선점 도출 → 재작성 → 최종 점검
사람이 보고서를 작성한 뒤 독자의 관점에서 다시 읽고 고치는 과정과 비슷합니다. 중요한 것은 단순히 “다시 생각하라”고 요구하는 것이 아니라, 무엇을 기준으로 평가하고 언제 수정을 끝낼 것인지 지정하는 것입니다.
Self-Refine은 AI 하네스와 어떤 관계일까
AI 하네스는 모델이 업무를 수행할 수 있도록 모델 주위에 설치하는 운영 구조입니다. 목표와 역할을 부여하고, 필요한 정보와 도구를 연결하며, 실행 순서와 평가 기준, 반복 횟수와 종료 조건을 통제합니다.
Self-Refine은 하네스 전체와 같은 개념은 아닙니다. 하네스 안에서 결과물의 품질을 높이는 핵심적인 피드백 루프에 가깝습니다.
프롬프트에 평가와 교정 절차를 넣는 것은 가장 간단한 형태의 ‘미니 하네스’를 만드는 것이라고 볼 수 있습니다. 이를 시스템으로 확장하면 AI가 기준을 충족할 때까지 결과물을 평가하고 개선하는 Evaluator–Optimizer 구조가 됩니다.
평가 기준이 있어야 교정의 방향이 생긴다
Self-Refine의 효과는 평가 기준의 구체성에 따라 달라집니다. 저는 정량 기준과 정성 기준을 함께 제시하는 방식을 권합니다.
정량 기준은 결과물의 충족 수준을 비교하고 종료 시점을 판단하게 합니다.
- 정확성: 30점
- 논리성과 구조: 25점
- 독자 적합성: 20점
- 실행 가능성: 15점
- 문체와 가독성: 10점
- 목표 점수: 총점 90점 이상
정성 기준은 숫자만으로 판단하기 어려운 품질을 점검하게 합니다.
- 사실과 의견이 구분되어 있는가
- 주장의 근거가 충분한가
- 독자가 한 번에 이해할 수 있는가
- 추상적인 설명보다 구체적인 행동을 제시하는가
- 불필요한 반복과 과장된 표현이 없는가
- 예상되는 오해와 위험을 고려했는가
정량 평가는 “얼마나 충족했는가”를 보여 주고, 정성 평가는 “무엇이 왜 부족한가”를 설명합니다. 두 기준을 결합해야 교정의 방향이 구체적으로 정해집니다.
실제로 활용할 수 있는 프롬프트
다음과 같이 요청할 수 있습니다.
당신은 대기업 홍보실장 겸 위기관리 책임자입니다. 아래 [메시지 초안]을 대상으로 Self-Refine을 최대 3회 실행하여 최종 안내문을 작성하세요.
1단계: 평가 기준 설정
다음 기준으로 초안을 100점 만점으로 평가하세요.
- 사실관계의 명확성: 25점
- 고객 관점과 공감: 25점
- 위기관리 적절성: 20점
- 논리적 구조: 15점
- 문체와 가독성: 15점
다음 정성 기준도 함께 검토하세요.
- 정중함이 부족하지 않은가
- 공격적이거나 방어적인 표현이 없는가
- 고객에게 책임을 전가하는 인상을 주지 않는가
- 회사의 책임과 향후 조치가 분명한가
- 법적·평판상 오해를 일으킬 표현이 없는가
2단계: 자가 피드백
각 기준의 점수와 판단 근거를 제시하고, 영향도가 높은 개선점 3가지를 도출하세요. 막연한 평가가 아니라 수정해야 할 문장과 수정 이유를 구체적으로 밝히세요.
3단계: 자가 교정
피드백을 모두 반영하여 격조 높고 따뜻한 비즈니스 문체의 안내문으로 재작성하세요.
4단계: 재평가와 종료
수정본을 같은 기준으로 다시 평가하세요. 총점이 90점 미만이거나 어느 한 항목이라도 배점의 80%에 미달하면 다시 교정하세요. 최대 3회까지만 반복하세요.
최종 출력에는 다음 내용만 포함하세요.
- 최종 점수와 항목별 점수
- 핵심 개선사항 3가지
- 최종 안내문
[메시지 초안]
여기에 초안을 입력하세요.
Self-Refine에도 한계가 있다
AI가 자신이 만든 답을 평가한다고 해서 그 평가가 항상 정확한 것은 아닙니다. 처음부터 사실을 잘못 이해했다면 같은 오류를 유지한 채 문장만 더 그럴듯하게 다듬을 수도 있습니다.
따라서 중요한 문서에는 다음과 같은 외부 검증이 필요합니다.
- 원자료 및 신뢰할 수 있는 출처와 대조
- 계산 결과를 코드나 별도 도구로 검증
- 다른 AI 또는 사람에게 독립적으로 평가 요청
- 법률·의료·재무 등 전문 영역은 전문가 확인
- 통과해서는 안 되는 조건을 별도의 체크리스트로 설정
Self-Refine은 AI를 더 많이 생각하게 만드는 기법이 아닙니다.
평가 기준을 중심으로 생성과 검토, 교정을 구조화하는 방법입니다.
좋은 결과는 반복 횟수에서 나오지 않습니다.
무엇을 좋은 결과로 볼 것인지 정의하고, 그 기준을 충족할 때까지 피드백이 순환하도록 설계하는 것. 이것이 단순한 프롬프트를 품질관리 시스템으로 바꾸는 출발점이며, AI 하네스로 발전하는 기초가 됩니다.