AI 도서집필 · 교육 · 컨설팅 문의 | ceo@peoplegrowth.co.kr multiosh@gmail.com
Essay

AI에게 “다시 잘 써 달라”고 하면 충분할까

2026-09-08

Self-Refine에서 AI 하네스로

AI가 만든 첫 번째 결과물이 마음에 들지 않을 때 우리는 흔히 이렇게 말합니다.

“조금 더 잘 써 주세요.”
“다시 검토해 주세요.”

그러나 무엇이 부족한지, 어떤 기준을 충족해야 하는지 알려 주지 않으면 두 번째 결과물도 표현만 달라질 뿐 품질은 크게 나아지지 않을 수 있습니다.

제가 AI 생성물의 품질을 높이기 위해 자주 활용하는 방법 중 하나가 Self-Refine, 즉 자가 피드백과 자가 교정입니다.

Self-Refine이란 무엇인가

Self-Refine은 AI가 만든 1차 결과물을 스스로 평가하고, 그 피드백을 반영하여 결과물을 다시 개선하는 방식입니다.

구조는 단순합니다.

초안 생성 → 자가 평가 → 개선점 도출 → 재작성 → 최종 점검

사람이 보고서를 작성한 뒤 독자의 관점에서 다시 읽고 고치는 과정과 비슷합니다. 중요한 것은 단순히 “다시 생각하라”고 요구하는 것이 아니라, 무엇을 기준으로 평가하고 언제 수정을 끝낼 것인지 지정하는 것입니다.

1차 결과를 스스로 평가하고, 정량 기준과 정성 기준으로 교정한 뒤 다시 평가합니다. 기준을 넘을 때까지 이 고리가 돕니다.

Self-Refine은 AI 하네스와 어떤 관계일까

AI 하네스는 모델이 업무를 수행할 수 있도록 모델 주위에 설치하는 운영 구조입니다. 목표와 역할을 부여하고, 필요한 정보와 도구를 연결하며, 실행 순서와 평가 기준, 반복 횟수와 종료 조건을 통제합니다.

Self-Refine은 하네스 전체와 같은 개념은 아닙니다. 하네스 안에서 결과물의 품질을 높이는 핵심적인 피드백 루프에 가깝습니다.

프롬프트에 평가와 교정 절차를 넣는 것은 가장 간단한 형태의 ‘미니 하네스’를 만드는 것이라고 볼 수 있습니다. 이를 시스템으로 확장하면 AI가 기준을 충족할 때까지 결과물을 평가하고 개선하는 Evaluator–Optimizer 구조가 됩니다.

Self-Refine은 하네스 전체가 아니라 그 안에서 도는 품질 개선 고리입니다. 목표·도구·메모리·통제가 그 둘레에 있습니다.

평가 기준이 있어야 교정의 방향이 생긴다

Self-Refine의 효과는 평가 기준의 구체성에 따라 달라집니다. 저는 정량 기준과 정성 기준을 함께 제시하는 방식을 권합니다.

정량 기준은 결과물의 충족 수준을 비교하고 종료 시점을 판단하게 합니다.

  • 정확성: 30점
  • 논리성과 구조: 25점
  • 독자 적합성: 20점
  • 실행 가능성: 15점
  • 문체와 가독성: 10점
  • 목표 점수: 총점 90점 이상

정성 기준은 숫자만으로 판단하기 어려운 품질을 점검하게 합니다.

  • 사실과 의견이 구분되어 있는가
  • 주장의 근거가 충분한가
  • 독자가 한 번에 이해할 수 있는가
  • 추상적인 설명보다 구체적인 행동을 제시하는가
  • 불필요한 반복과 과장된 표현이 없는가
  • 예상되는 오해와 위험을 고려했는가

정량 평가는 “얼마나 충족했는가”를 보여 주고, 정성 평가는 “무엇이 왜 부족한가”를 설명합니다. 두 기준을 결합해야 교정의 방향이 구체적으로 정해집니다.

실제로 활용할 수 있는 프롬프트

다음과 같이 요청할 수 있습니다.

당신은 대기업 홍보실장 겸 위기관리 책임자입니다. 아래 [메시지 초안]을 대상으로 Self-Refine을 최대 3회 실행하여 최종 안내문을 작성하세요.

1단계: 평가 기준 설정

다음 기준으로 초안을 100점 만점으로 평가하세요.

  • 사실관계의 명확성: 25점
  • 고객 관점과 공감: 25점
  • 위기관리 적절성: 20점
  • 논리적 구조: 15점
  • 문체와 가독성: 15점

다음 정성 기준도 함께 검토하세요.

  • 정중함이 부족하지 않은가
  • 공격적이거나 방어적인 표현이 없는가
  • 고객에게 책임을 전가하는 인상을 주지 않는가
  • 회사의 책임과 향후 조치가 분명한가
  • 법적·평판상 오해를 일으킬 표현이 없는가

2단계: 자가 피드백

각 기준의 점수와 판단 근거를 제시하고, 영향도가 높은 개선점 3가지를 도출하세요. 막연한 평가가 아니라 수정해야 할 문장과 수정 이유를 구체적으로 밝히세요.

3단계: 자가 교정

피드백을 모두 반영하여 격조 높고 따뜻한 비즈니스 문체의 안내문으로 재작성하세요.

4단계: 재평가와 종료

수정본을 같은 기준으로 다시 평가하세요. 총점이 90점 미만이거나 어느 한 항목이라도 배점의 80%에 미달하면 다시 교정하세요. 최대 3회까지만 반복하세요.

최종 출력에는 다음 내용만 포함하세요.

  • 최종 점수와 항목별 점수
  • 핵심 개선사항 3가지
  • 최종 안내문

[메시지 초안]
여기에 초안을 입력하세요.

Self-Refine에도 한계가 있다

AI가 자신이 만든 답을 평가한다고 해서 그 평가가 항상 정확한 것은 아닙니다. 처음부터 사실을 잘못 이해했다면 같은 오류를 유지한 채 문장만 더 그럴듯하게 다듬을 수도 있습니다.

따라서 중요한 문서에는 다음과 같은 외부 검증이 필요합니다.

  • 원자료 및 신뢰할 수 있는 출처와 대조
  • 계산 결과를 코드나 별도 도구로 검증
  • 다른 AI 또는 사람에게 독립적으로 평가 요청
  • 법률·의료·재무 등 전문 영역은 전문가 확인
  • 통과해서는 안 되는 조건을 별도의 체크리스트로 설정

Self-Refine은 AI를 더 많이 생각하게 만드는 기법이 아닙니다.
평가 기준을 중심으로 생성과 검토, 교정을 구조화하는 방법입니다.

좋은 결과는 반복 횟수에서 나오지 않습니다.

무엇을 좋은 결과로 볼 것인지 정의하고, 그 기준을 충족할 때까지 피드백이 순환하도록 설계하는 것. 이것이 단순한 프롬프트를 품질관리 시스템으로 바꾸는 출발점이며, AI 하네스로 발전하는 기초가 됩니다.

← 1호 · 글 목록 · 3호 →