AI의 사실 검증 능력을 비교하려면 문장이 자연스러운지만 볼 것이 아니라 최종 답, 실제 근거, 정정된 수치, 자료에 없는 내용을 추측하지 않는지를 분리해서 확인할 수 있어야 합니다.
이번 Siftano 실측 flagship 평가에서는 ChatGPT와 Claude에 같은 합성 source packet, 같은 고정 prompt, 같은 12개 질문을 제공했습니다. 제품별 최초 응답 한 번만 보존했고, 제품 실행 전에 작성해 둔 answer key로 각 문항을 채점했습니다.
결과는 매우 좁은 범위에서 해석해야 합니다.
- ChatGPT: 24/24
- Claude: 23/24
- 두 제품 모두 12개 문항의 최종 답은 정확했습니다.
- 두 제품 모두 나중에 정정된 과거 수치를 최종값으로 사용하지 않았습니다.
- 두 제품 모두 자료에 없는 retention period나 mobile-app test를 만들어내지 않았습니다.
- 계산 오류는 없었습니다.
- 유일한 점수 차이는 F1-07의 구조화된 출처 표기 완전성이었습니다.
따라서 이 결과를 “ChatGPT가 Claude보다 전반적으로 더 정확하다”는 주장으로 확대해서는 안 됩니다. 이 글이 보여주는 것은 2026-08-30 동일 조건에서 한 번씩 실행한 하나의 source-grounded verification fixture 결과입니다.
무엇을 테스트했나
F1은 평가 전용으로 만든 가상의 Northstar Workspace Pilot 자료를 사용합니다. 자료에는 charter, 예산 memo, 초기 evaluation summary, correction notice, final addendum, operations note가 들어 있습니다. 실제 고객이나 회사의 비공개 데이터는 사용하지 않았습니다.
12개 문항은 다음과 같은 실제 검증 실패를 잡도록 설계했습니다.
- 정정 공지가 있는데도 과거 수치를 최신값으로 사용하는가
- 잘못된 denominator로 percentage를 계산하는가
- 예산 상한과 실제 지출을 혼동하는가
- 여러 조건을 모두 만족해야 하는 규칙에서 한 조건을 빠뜨리는가
- source에 없는 policy를 만들어내는가
- desktop web 사용 기록만 있는데 native mobile app을 테스트했다고 추론하는가
- 결론은 맞더라도 실제 사용한 출처를 structured source field에 빠뜨리는가
합성 fixture이므로 테스트 결과가 그날의 웹 검색 결과나 외부 정보 변화에 의존하지 않습니다.
테스트 조건
두 실행은 같은 Windows PC와 같은 Codex 인앱 브라우저 환경에서 진행했습니다.
| 조건 | ChatGPT | Claude |
|---|---|---|
| Plan | Pro | Pro |
| UI에서 확인된 모델/버전 | 표시되지 않음 | Sonnet 5 · 중간 |
| 세션 | Temporary Chat | Incognito |
| 웹 검색/리서치 도구 | 사용 안 함 | Off |
| 실행 횟수 | 1 | 1 |
| Follow-up | 0 | 0 |
| Retry | 0 | 0 |
두 실행의 source file SHA-256은 동일했습니다.
A5E6C0E592D00CAE345858C9A1591205AF1F346D516BDB591673CA49EB66784B
고정 prompt SHA-256도 동일했습니다.
C826AC81128CD0A4759CD109A60D0250B9A07AF1BF00C787E6F50FBD1B4C61BF
ChatGPT의 정확한 모델명은 계정 유형이나 답변 스타일로 추정하지 않았습니다. 테스트 당시 UI에 모델명이 표시되지 않았으므로 그대로 확인 불가로 남겼습니다.
채점 기준
각 문항은 독립적으로 채점했습니다.
| 점수 | 기준 |
|---|---|
| 2 | 최종 답, 출처 선택, 필요한 계산 또는 이유가 모두 정확함 |
| 1 | 최종 답은 맞지만 출처, 계산 상세, 조건 설명 중 일부가 불완전함 |
| 0 | 오답, 과거값을 최종값으로 사용, unsupported claim 발명, 필요한 NOT SUPPORTED 상태를 인식하지 못함 |
최대 점수는 24점입니다.
별도로 STALE_VALUE_USED, UNSUPPORTED_CLAIM_INVENTED, SOURCE_ID_INVENTED, CALCULATION_ERROR, CONDITION_DROPPED, FORMAT_CONTRACT_BROKEN 여섯 failure flag도 확인했습니다. 이번 실행에서는 두 제품 모두 해당 flag가 발생하지 않았습니다.
문항별 결과
| Case | 확인 항목 | 기대 결과 | ChatGPT | Claude |
|---|---|---|---|---|
| F1-01 | 정정된 eligible enrollment | 84 | 2 | 2 |
| F1-02 | 변하지 않은 completion count | 71 | 2 | 2 |
| F1-03 | 정정된 completion rate | 84.52% = 71/84 | 2 | 2 |
| F1-04 | 정정된 escalation count | 96 | 2 | 2 |
| F1-05 | 정정된 escalation rate | 3.98% = 96/2,410 | 2 | 2 |
| F1-06 | 실제 지출과 budget ceiling 구분 | USD 15,480 | 2 | 2 |
| F1-07 | 세 조건을 모두 요구하는 성공 규칙 | No; severity-1 incident 발생 | 2 | 1 |
| F1-08 | severity-1 incident count | 1 | 2 | 2 |
| F1-09 | 외부 발송 전 human approval | Yes | 2 | 2 |
| F1-10 | 자료에 없는 retention period | NOT SUPPORTED | 2 | 2 |
| F1-11 | 자료에 없는 native-mobile test | NOT SUPPORTED | 2 | 2 |
| F1-12 | enrollment cap과 실제 enrollment 구분 | 90 vs 84; 서로 다름 | 2 | 2 |
| 합계 | 24/24 | 23/24 |
Claude의 F1-07 결론 자체는 정확했습니다. 1점 차이는 오답이 아니라 structured source field의 완전성 때문입니다.
유일한 점수 차이: F1-07
F1-07은 pilot이 charter의 complete success definition을 충족했는지와 결정적인 이유를 물었습니다. Charter는 다음 세 조건을 모두 만족해야 성공이라고 정의했습니다.
- completion rate 80% 이상
- factual-error escalation rate 4.0% 미만
- severity-1 security incident 0건
정정된 completion rate는 84.52%, escalation rate는 3.98%라서 앞의 두 조건은 통과했습니다. 하지만 severity-1 incident가 1건 발생했으므로 complete success definition은 충족되지 않았습니다. 두 제품 모두 이 결론은 맞았습니다.
ChatGPT
ChatGPT의 구조화된 source_id는 A1,E1이었습니다. A1은 세 조건을 정의하고 E1은 정정된 최종 결과와 incident를 기록합니다. 필요한 출처가 모두 포함되어 2점을 받았습니다.
Claude
Claude의 source_id에는 E1만 들어 있었습니다. 그러나 같은 행의 reasoning에서는 세 조건이 모두 필요하다고 설명하면서 A1을 직접 언급했습니다. 즉 실제 reasoning에는 A1을 사용했지만 structured citation field에는 포함하지 않았습니다.
사전 고정 rubric에서는 최종 결론이 맞더라도 source selection이 불완전하면 1점이므로 F1-07은 1/2점으로 채점했습니다.
이 차이는 사람이 긴 reasoning을 다시 읽지 않고 source_id만 확인하거나 downstream system이 구조화된 citation field를 직접 사용할 때 의미가 있습니다.
두 제품이 모두 정확하게 처리한 부분
과거값과 정정된 값을 구분했다
초기 draft에는 enrolled participants 86, completion rate 82.6%, escalation 102건, escalation rate 4.23%가 있었습니다. 이후 correction notice에서 최종 eligible enrollment는 84로 줄었고 escalation ticket 6개가 duplicate로 확인됐습니다. 두 제품 모두 초기값이 아니라 정정된 최종값을 사용했습니다.
정정된 입력값으로 계산했다
두 제품 모두 71 / 84 × 100 = 84.52%, 96 / 2,410 × 100 = 3.98%를 정확히 계산했습니다. CALCULATION_ERROR는 발생하지 않았습니다.
예산과 실제 지출을 혼동하지 않았다
Procurement memo의 USD 18,000은 최대 예산이었고 실제 invoiced software spend는 USD 15,480이었습니다. 두 제품 모두 실제 지출액을 답했습니다.
자료에 없는 내용은 NOT SUPPORTED로 남겼다
Source packet에는 vendor data-retention period가 정의되어 있지 않았고 native mobile application을 테스트했다는 기록도 없었습니다. 두 제품 모두 그럴듯한 기간이나 test 결과를 추측하지 않고 NOT SUPPORTED를 반환했습니다.
검증 업무에서는 무엇을 아는지만큼 자료만으로 확인할 수 없는 것을 그대로 남기는 능력도 중요합니다.
이 테스트가 증명하지 않는 것
F1은 하나의 합성 fixture입니다. Coding, open-web research, creative writing, agent tool use, 일반적인 reasoning 성능을 측정하지 않습니다.
제품별 최초 응답 한 번만 평가했기 때문에 follow-up prompt로 오류를 얼마나 잘 수정하는지도 이번 범위가 아닙니다.
제품은 계속 바뀝니다. 이 결과는 2026-08-30에 기록한 환경과 직접 연결됩니다. Claude는 UI에 Sonnet 5 · 중간이 표시됐지만 ChatGPT의 정확한 모델명은 테스트 UI에서 확인할 수 없었습니다.
마지막으로 1점 차이는 잘못된 최종 답 때문이 아니라 citation structure의 불완전성 때문입니다. 24/24와 23/24만 보고 한 제품이 전반적으로 더 사실적이라고 결론 내리면 이번 증거의 범위를 넘어섭니다.
실제로 얻을 수 있는 결론
이번 fixture에서는 두 제품 모두 강한 source-grounded 최초 응답을 냈습니다. 의미 있는 차이는 자연어 답변 자체보다 reasoning에서 실제 사용한 출처가 structured citation field에도 완전하게 남는가에서 나타났습니다.
출처 검증 workflow에서는 다음 네 가지를 따로 확인하는 것이 좋습니다.
- 최종 문장이 맞는가?
- 가장 최신의 적용 가능한 출처를 사용했는가?
- 정정된 입력값으로 계산했는가?
- reasoning에 실제로 의존한 모든 출처가 structured citation output에도 포함되어 있는가?
자연스러운 설명은 앞의 세 조건을 만족하면서도 네 번째 조건을 놓칠 수 있습니다.
더 넓은 검증 절차는 AI 답변의 출처와 사실을 검증하는 8단계를 참고할 수 있습니다.
다음 테스트
F1 하나만으로 일반적인 ChatGPT-vs-Claude 추천을 만들지는 않습니다. 서로 다른 실패 유형을 보는 독립 fixture를 계속 실행할 예정입니다.
- F2 — 긴 문서 요약 충실도: 정정사항, 누락, 예외조건, metric scope, unsupported ROI 주장
- F3 — 구조화 CSV 분석: weighted aggregation, missing value, cost ranking, filtering, arithmetic
여러 독립 fixture에서 같은 방향의 차이가 반복될 때만 더 넓은 제품 판단을 하는 것이 적절합니다.

