장문 요약은 핵심 숫자가 맞아도 의사결정을 바꾸는 조건 하나를 조용히 빠뜨릴 수 있습니다. F2에서는 동일한 합성 운영 보고서를 ChatGPT와 Claude에 입력하고, 수정된 값·큐별 약점·인시던트 맥락·범위 제한·추정 시간과 금전적 ROI의 경계를 압축 과정에서 얼마나 보존하는지 확인했습니다.
결과는 일반적인 제품 순위가 아니라 이 테스트에 한정됩니다.
- ChatGPT: 40/44 (90.91%)
- Claude: 43/44 (97.73%)
- 두 제품 모두 잘못된 초기값 6,310이 아니라 수정된 6,240 티켓을 사용
- 두 제품 모두 7.1%가 아니라 수정된 전체 재오픈율 6.9%를 사용
- 두 제품 모두 Technical 큐의 7.2분 / 8.4% 약점을 보존
- 두 제품 모두 severity-2 프라이버시 인시던트를 공개해 "인시던트 없음"으로 과장하지 않음
- 두 제품 모두 314시간 추정치를 현금 절감이나 금전적 ROI로 변환하지 않음
3점 차이는 핵심 숫자의 오답이 아니라 요약의 조건 보존 완전성에서 나왔습니다.
무엇을 테스트했나
F2는 평가용으로 만든 가상의 Harborline 고객지원 시험 운영 보고서를 사용합니다. 전체 성공 조건, 이후 수정되는 초기 수치, 큐별 지표, 프라이버시 인시던트, 낮은 응답률의 설문, 수동 검증 오버헤드, 명시적인 범위 제외 조건을 한 문서에 넣었습니다.
고정 프롬프트는 정확히 두 부분을 요구했습니다.
- 250단어 이하 executive summary
- 정해진 순서의 12개 핵심 사실 표
테스트가 겨냥한 실패 유형은 다음과 같습니다.
- 나중에 수정된 값 대신 이전 값을 최종값으로 사용
- 전체 기준만 통과했는데 모든 큐가 기준을 충족했다고 요약
- severity-1이 0이라는 사실을 "인시던트 없음"으로 확대
- 모든 대외 응답에 인간 승인이 필요했다는 조건 누락
- 36% 설문 응답률을 대표성 있는 고객 만족도로 확대
- 음성, 비영어, USD 500 초과 환불이 제외됐다는 범위 누락
- 노동비 가정이 없는데 추정 시간을 현금 ROI로 변환
실제 고객 데이터는 사용하지 않았습니다.
테스트 조건
| 조건 | ChatGPT | Claude |
|---|---|---|
| 실행일 | 2026-08-30 | 2026-08-31 |
| UI에 표시된 플랜 | Pro | 표시되지 않음 |
| UI에 표시된 모델/버전 | 표시되지 않음 | Sonnet 5 · 중간 |
| 세션 | Temporary Chat | Incognito / 시크릿 채팅 |
| 웹 검색·리서치 | 사용 안 함 | 사용 안 함 |
| 완료 실행 follow-up | 0 | 0 |
| 완료 실행 retry | 0 | 0 |
Claude는 앞선 시도에서 제품의 5시간 사용 한도 화면이 나타나 실행이 지연됐습니다. 한도가 초기화된 뒤 동일 fixture를 한 번 실행했습니다. 사용 한도 화면 자체는 모델 응답으로 채점하지 않았습니다.
두 제품이 사용한 원문 SHA-256은 같습니다.
0CDEC648D9CAF891B59628C5A56A853124659C4F580BA4B0A431BE03CA24445E
고정 프롬프트 SHA-256도 같습니다.
F1A1EDC069E264ACCAE93AFE4C53370C301959B73A39F8F1A847C5C7B69B1697
44점 채점 기준
테스트는 두 부분으로 나뉩니다.
핵심 사실: 24점
12개 행을 각각 2점으로 채점했습니다.
| 점수 | 의미 |
|---|---|
| 2 | 값과 중요한 qualification이 모두 정확 |
| 1 | 핵심 값은 맞지만 중요한 qualification이 불완전 |
| 0 | 값이 틀렸거나 오래된 값·근거 없는 값·누락 |
Executive summary: 20점
10개의 필수 개념을 각각 2점으로 봤습니다. 전체 성공 결론, 수정된 응답 및 재오픈 지표, severity-2 인시던트, Technical 큐 약점, 필수 인간 승인, 96시간 검증 오버헤드를 뺀 314시간 추정치, 범위 제외, 설문 한계, 금전적 ROI 부재가 포함됩니다.
최종 점수
| 구성 | ChatGPT | Claude |
|---|---|---|
| 12개 핵심 사실 | 23/24 | 23/24 |
| Executive summary | 17/20 | 20/20 |
| 총점 | 40/44 | 43/44 |
두 제품 모두 F2-01에서 1점을 잃었습니다. 4월 6일부터 5월 22일까지라는 날짜는 맞았지만, 해당 행의 qualification에 내부 영어 텍스트 지원 시험이라는 범위를 완전히 다시 적지 않았습니다.
나머지 차이는 executive summary에서 발생했습니다.
ChatGPT가 요약에서 놓친 부분
ChatGPT는 세 가지 전체 성공 조건, Technical 큐의 약점, severity-2 프라이버시 인시던트, 314시간 순추정치, 36% 설문 한계, 금전적 ROI 부재를 정확히 기록했습니다.
다만 두 qualification은 덜 완전했습니다.
- 인간 검토가 프라이버시 문제를 고객에게 나가기 전에 잡았다고 적었지만, executive summary 안에서 모든 customer-facing reply가 공개 전 인간 승인을 받아야 했다는 지속적인 규칙을 명시적으로 다시 적지는 않았습니다.
- 음성 통화, 비영어 대화, USD 500 초과 환불이 시험 범위 밖이라는 조건을 executive summary에서 빠뜨렸습니다.
이 사실들은 ChatGPT의 12행 표에는 들어 있었습니다. 따라서 원문을 이해하지 못하거나 사실을 발명한 오류와는 다릅니다. 채점 기준은 운영 책임자가 executive summary만 읽어도 모든 필수 제한조건을 받을 수 있는지를 봤습니다.
Claude가 executive summary에 보존한 것
Claude는 같은 수정된 전체 수치와 함께 압축 과정에서 빠지기 쉬운 조건까지 유지했습니다.
- 모든 AI 초안은 인간 검토와 승인을 거쳐야 함
- Technical 큐는 전체 benchmark를 충족하지 못함
- 시험은 incident-free가 아님
- 314시간은 추정치이며 payroll/cash ROI가 아님
- 설문은 전체 성공 판단에 사용되지 않음
- 음성, 비영어, USD 500 초과 환불은 시험 범위 밖
이 차이가 summary 20/20의 이유입니다.
두 제품이 모두 잘 처리한 부분
초기값보다 수정값을 우선했다
두 제품 모두 중복 70건을 제거한 뒤의 6,240 티켓을 사용했습니다. 전체 재오픈율도 초기 7.1%가 아니라 수정된 6.9%를 사용했습니다.
전체 성공과 약한 큐를 구분했다
시험 전체는 5.9분 응답시간과 6.9% 재오픈 기준을 충족했지만 Technical은 7.2분, 8.4%였습니다. 두 제품 모두 이 차이를 숨기지 않았습니다.
severity-1이 0이라는 사실을 "인시던트 없음"으로 바꾸지 않았다
severity-2 프라이버시 인시던트가 1건 있었고 인간 검토 단계에서 고객에게 나가기 전에 발견됐습니다. 두 요약 모두 이를 공개했습니다.
시간 절감을 금전 절감으로 바꾸지 않았다
보고서는 410시간의 총 절감 추정치에서 96시간의 수동 검증을 빼 314시간의 순추정치를 제시했습니다. 승인된 노동비 수치가 없었기 때문에 두 제품 모두 이를 급여 절감이나 현금 ROI로 바꾸지 않았습니다.
이 테스트가 증명하지 않는 것
F2는 하나의 합성 장문 fixture입니다. 매우 긴 context window, 복잡한 시각 구조를 가진 PDF, 웹 리서치, 다국어 원문, 반복 프롬프팅을 측정하지 않습니다.
두 제품의 실행 시각도 같지 않습니다. ChatGPT는 8월 30일, Claude는 사용 한도 초기화 후 8월 31일에 실행했습니다. 원문과 프롬프트는 동일하게 고정했지만 제품 동작은 시간에 따라 달라질 수 있습니다.
무엇보다 43/44 대 40/44를 Claude가 일반적으로 더 좋은 요약 제품이라는 결론으로 확대할 수는 없습니다. 이 fixture에서 두 제품은 중요한 숫자를 모두 맞췄고, 차이는 Claude의 executive summary가 사전에 정의한 qualification을 더 많이 보존했다는 점입니다.
실무적으로 무엇을 확인할까
장문 요약을 검토할 때 다음 네 가지를 분리해 확인하는 것이 좋습니다.
- 초기값이 아니라 최종 수정값을 썼는가?
- 전체 결과와 하위 그룹의 약점을 구분했는가?
- 인시던트·예외·범위 제한을 보존했는가?
- 추정치를 더 강한 금전적 주장으로 바꾸지 않았는가?
첫 번째를 통과해도 네 번째에서 실패할 수 있습니다.
앞선 출처 기반 검증 실험은 ChatGPT vs Claude 출처 기반 사실 검증 비교에서 볼 수 있습니다.
F3에서는 장문 압축이 아니라 고정 CSV의 계산과 결측값 처리를 별도로 테스트합니다.

