CSV 비교를 단순한 완전 데이터의 산술 문제로 만들면 제품 차이가 과장되거나 반대로 너무 쉽게 무승부가 될 수 있습니다. F3는 의도적으로 비용 결측값 하나를 넣고 가중 비율, 팀 필터링, 순위, 계산 재현성을 함께 요구했습니다.
보존된 결과의 점수는 같았습니다.
- ChatGPT recovery run: 24/24
- Claude 보존된 최초 완료 실행: 24/24
- 12개 예상 답을 두 제품 모두 정확히 맞춤
- 두 제품 모두 빈 비용을 0으로 처리하지 않음
- 두 제품 모두 USD 1,343을 완전한 전체 비용이라고 부르지 않음
- 두 제품 모두 비용이 불완전한 Epsilon을 전체 기간 cost-per-success 순위에 넣지 않음
- 두 제품 모두 단순 평균이 아니라 가중 성공률을 사용
중요한 제한은 실행 이력입니다. 이 결과는 깔끔한 first-attempt 대 first-attempt 비교가 아닙니다.
무엇을 테스트했나
F3는 6개 팀의 3개월 데이터를 담은 18행 합성 CSV를 사용합니다. requests, successful, review_minutes, incidents는 모두 채워져 있지만 cost_usd 한 칸—Epsilon의 2026년 2월—은 의도적으로 비어 있습니다.
고정 프롬프트의 12개 질문은 다음을 포함합니다.
- 전체 requests와 successes
- 전체 가중 성공률
- 가장 높은 팀 가중 성공률
- 가장 많은 인시던트 팀
- 비용 데이터가 완전한 팀만 대상으로 한 성공 1건당 비용
- known cost 합계를 완전한 총비용으로 오인하지 않는지
- 모든 비용 결측 행 식별
- 3월만의 가중 성과
- 성공 1건당 review minutes
- 100 requests당 incident rate
추가로 비용 분석에 영향을 주는 결측값을 명시하는 짧은 Data quality 섹션을 요구했습니다.
테스트 조건
| 조건 | ChatGPT | Claude |
|---|---|---|
| 보존된 실행일 | 2026-08-30 | 2026-08-31 |
| UI에 표시된 플랜 | Pro | 표시되지 않음 |
| UI에 표시된 모델/버전 | 표시되지 않음 | Sonnet 5 · 중간 |
| 웹 검색·리서치 | 사용 안 함 | 사용 안 함 |
| 자체 data analysis 사용 관찰 | 예 | 예 |
| Follow-up | 0 | 0 |
| 채점된 보존 결과의 retry | 승인된 recovery 1회 | 0 |
CSV SHA-256은 동일합니다.
3DD5D56F100DA9B98A02FD363701EE30CBA0EBEBE87A3C4C3F531C5605C0B5B8
고정 프롬프트 SHA-256도 동일합니다.
5986629BCAA35F39E7546C94E1D0BBE039572D8BAC73BEA9954365C8DAAF9245
ChatGPT 결과에 recovery라는 이름을 붙인 이유
ChatGPT의 최초 응답 자체는 완료됐지만 Temporary Chat 탭이 사라지면서 raw response와 screenshot을 보존하지 못했습니다. 보이지 않는 최초 결과를 나중에 기억으로 복원해 채점하지 않았습니다.
사용자가 recovery rerun을 명시적으로 승인한 뒤 동일 CSV와 정확히 같은 fixed prompt를 다시 사용했습니다. 이 recovery 실행의 raw response와 screenshot을 보존했고, ChatGPT 24/24는 이 recovery output의 점수입니다.
Claude는 앞선 사용 한도 blocker가 초기화된 뒤 실행한 첫 완료 응답을 그대로 보존했습니다.
따라서 두 점수가 모두 실사용 evidence이더라도 F3를 first-attempt 승부라고 표현하면 안 됩니다.
24점 채점 기준
각 case는 2점입니다.
| 점수 | 의미 |
|---|---|
| 2 | 답, 산술, 필요한 data-quality qualification이 모두 정확 |
| 1 | 최종 결과는 맞지만 계산 또는 중요한 qualification이 불완전 |
| 0 | 오답, 잘못된 필터, 비가중 비율, 결측을 0으로 처리, 근거 없는 완전 총계 주장 |
Case별 결과
| Case | 예상 결과 | ChatGPT recovery | Claude |
|---|---|---|---|
| F3-01 | 1,860 requests | 2 | 2 |
| F3-02 | 1,602 successful requests | 2 | 2 |
| F3-03 | 86.13% 가중 성공률 | 2 | 2 |
| F3-04 | Gamma, 93.21% | 2 | 2 |
| F3-05 | Delta, 6 incidents | 2 | 2 |
| F3-06 | 13 incidents | 2 | 2 |
| F3-07 | 완전 비용 팀 중 Alpha, 성공당 USD 0.78 | 2 | 2 |
| F3-08 | known cost USD 1,343, 완전 총계 아님 | 2 | 2 |
| F3-09 | record 14, Epsilon, 2026-02 | 2 | 2 |
| F3-10 | 645 requests, 561 successes, 86.98% | 2 | 2 |
| F3-11 | Zeta, 성공당 4.25 review minutes | 2 | 2 |
| F3-12 | Delta, 100 requests당 1.33 incidents | 2 | 2 |
| 총점 | 24/24 | 24/24 |
가장 중요한 행은 빈 칸이었다
비어 있는 비용을 처리할 때 여러 그럴듯한 오류가 생길 수 있습니다.
- 결측값을 조용히 0으로 처리
- Epsilon을 완전한 기간 비용 순위에 그대로 포함
- 알려진 비용만 더하고 완전한 총비용이라고 표기
- 불완전한 행을 말없이 제거
두 제품 모두 네 가지 오류를 피했습니다.
Epsilon 2026-02를 유일한 비용 결측으로 식별했고, complete-cost ranking에서 Epsilon을 제외했으며, USD 1,343을 전체 비용이 아니라 알려진 비용의 합계로 설명했습니다.
가중 비율도 정확했다
전체 성공률은 6개 팀 성공률의 단순 평균이 아닙니다. 고정 규칙은 sum(successful) / sum(requests)를 요구했습니다.
두 제품 모두 다음 값을 반환했습니다.
- 1,860 requests 중 1,602 successful
- 전체 가중 성공률 86.13%
- 가장 높은 팀은 Gamma 93.21%
- 3월은 561 / 645 = 86.98%
Zeta의 review-minutes 계산과 Delta incident rate도 최종 숫자만 던지지 않고 계산을 재현했습니다.
공식 failure flag는 발생하지 않았다
채점된 결과에서 두 제품 모두 다음 사전 정의 failure flag를 발생시키지 않았습니다.
- missing cost를 zero로 처리
- 불완전 비용을 complete라고 주장
- incomplete team을 비용 순위에 포함
- unweighted rate 사용
- filter error
- arithmetic error
- wrong extreme team
- data-quality note 누락
- format contract 위반
이 결과가 증명하지 않는 것
F3는 작은 합성 표입니다. 병합 셀, 수식, 여러 시트, 모호한 날짜 형식, 매우 큰 데이터셋, 외부 join, 도메인 지식이 필요한 업무 규칙을 테스트하지 않습니다.
또한 일반적으로 두 제품의 데이터 분석 신뢰도가 동일하다는 결론도 낼 수 없습니다. 이 fixture에서는 둘 다 맞았지만 ChatGPT evidence는 승인된 recovery run이고 Claude 점수는 보존된 첫 완료 실행에서 나왔습니다.
따라서 이 결과는 가중 계산과 결측값 처리에 대한 제한된 관찰이지 범용 데이터 분석 순위가 아닙니다.
실무적으로 무엇을 확인할까
AI가 만든 표 분석을 받아들일 때 최소한 다음을 확인하는 것이 좋습니다.
- 전체 비율이 실제 count로 가중됐는가?
- 빈 값과 0을 구분했는가?
- metric이 완전성을 요구할 때만 불완전한 record를 제외했는가?
- known-value subtotal을 불완전한 값이라고 명확히 표시했는가?
F3에서 두 제품은 이 규칙을 모두 충족했습니다. 다음 F4에서는 사용자가 실제 decision-ready 결과를 요청하고, 한 번 수정 지시를 보낸 뒤, 결과를 보존·내보내는 workflow를 별도로 살펴봅니다.
앞선 장문 요약 실험은 ChatGPT vs Claude 장문 요약 비교에서 볼 수 있습니다.

