30분 시험으로 AI 도구의 안전성, 정확성, 경제성 또는 production 적합성을 입증할 수는 없습니다. 그러나 맞지 않는 제품을 몇 주 동안 연동하기 전에 명백한 문제를 드러낼 수는 있습니다.
흔한 실수는 trial을 시연처럼 사용하는 것입니다. 쉬운 질문을 하고, 자연스러운 답변을 보고, 기능 목록을 비교합니다. 유용한 평가는 실제 업무 하나, 알려진 승인 기준, 실패 사례와 의사결정 규칙에서 시작합니다.
NIST의 AI 시험·평가·검증 활동은 사용 맥락, 의미 있는 과제, 측정 가능한 특성, 한계와 지속적 평가를 강조합니다. AI RMF와 GAO 책임성 프레임워크도 목표, 데이터, 성능, 모니터링과 go/no-go 결정을 연결합니다. 아래 시나리오는 이 원칙을 짧은 screening test로 압축합니다. 보안·개인정보·법률·접근성 검토, 구매 절차와 production pilot을 대체하지 않습니다.
0–3분: 업무와 중단 조건 정의하기
반복 업무를 한 문장으로 씁니다.
제공된 조사 문서를 운영 책임자가 10분 안에 승인할 수 있는 출처 연결형 요약으로 만든다.
“생산성 향상”이나 “글쓰기 지원” 같은 넓은 목표는 피합니다. 시험에는 관찰 가능한 결과와 책임자가 필요합니다.
다음을 기록합니다.
- 실제 사용자와 검토자;
- 입력 형식과 민감도;
- 기대 결과물;
- 허용 가능한 최대 시간;
- 필요한 출처와 증거;
- 즉시 탈락시킬 오류;
- 도구가 해서는 안 되는 행동.
결과 상태는 세 가지로 제한합니다.
- PASS — 대표 업무가 제한된 검토 작업으로 최소 기준을 충족함;
- CANDIDATE — 유용한 동작은 있지만 긴 pilot에서 확인할 문제가 남음;
- BLOCKED — 필수 통제, 결과 또는 업무 조건이 실패함.
금지된 데이터를 요구하거나, 영향 있는 행동을 제한할 수 없거나, 필수 account·workspace 통제가 없으면 바로 중단합니다.
3–6분: 정확한 제품 범위 기록하기
결과 품질을 보기 전에 실제 시험 대상을 기록합니다.
- 공급자와 제품;
- plan 또는 trial 유형;
- 표시되는 경우 model 또는 mode;
- 지역과 언어;
- web, desktop, mobile, API 또는 integration surface;
- 활성화된 tool, connector, memory, retrieval, browsing;
- 시험 날짜와 시각;
- 관련 account 설정.
browsing과 connector가 있는 유료 workspace 결과는 free account나 API deployment를 대표하지 않습니다. preview model은 구매 전에 바뀔 수 있습니다. 숨은 기본값도 데이터 처리, 도구 사용과 품질에 영향을 줍니다.
화면을 캡처하거나 짧은 environment record를 남깁니다. 목적은 문서 작업이 아니라 결과가 생성 환경과 분리되지 않게 하는 것입니다.
6–13분: 대표 정상 사례 실행하기
평소 업무와 비슷한 비민감 실제 입력을 사용합니다. 결과를 본 뒤 도구에 맞춰 prompt를 계속 최적화하지 않습니다. 짧고 재사용 가능한 지시로 시작합니다.
예시:
첨부 문서를 운영 책임자용으로 요약한다. 원문 사실, 해석, 미확인을 구분하고 중요한 주장마다 페이지나 section을 연결한다. 문서가 지원하지 않는 사실은 추가하지 않는다.
전체 업무 흐름을 관찰합니다.
- 설정 시간;
- upload와 parsing 동작;
- 응답 지연;
- 결과 완전성;
- 출처 연결;
- 형식 안정성;
- 검토자가 수정한 양;
- 복사·export·handoff 가능성.
자연스러운 문체만 점수화하지 않습니다. 지정된 사용자가 실제 업무를 완료하는 데 도움이 되는지 기록합니다.
정상 사례는 사전에 정한 승인 기준을 충족해야 통과합니다. “좋아 보인다”는 승인 기준이 아닙니다.
13–18분: 실패 또는 edge case 실행하기
happy path에서 성공한 도구도 입력이 불완전하거나 충돌하거나 길거나 형식이 나쁘면 위험하게 실패할 수 있습니다.
현실적인 stress case 하나를 고릅니다.
- 원문 안의 상충 주장;
- 필수 필드 누락;
- 모호한 지시;
- 지원하지 않는 파일 형식;
- 긴 표;
- 최신 정보가 필요한 주장;
- 명령처럼 보이지만 비신뢰 데이터로 처리해야 할 문장;
- 거절 또는 사람 escalation이 필요한 요청.
도구가 다음 행동을 하는지 확인합니다.
- 없는 값을 만들어냄;
- 불확실성을 숨김;
- 원문에 포함된 지시를 실행 명령으로 따름;
- 내용을 조용히 잘라냄;
- 근거 범위 밖에서 확신함;
- 민감 입력을 노출함;
- 명확한 승인 없이 외부 행동을 실행함;
- 실패 후 복구를 어렵게 만듦.
최종 수정 결과만 남기지 말고 최초 실패와 수정 과정을 기록합니다. 오류 발견·수정 비용도 제품 성능의 일부입니다.
18–22분: 중요한 주장 또는 계산 하나 독립 검증하기
틀리면 의사결정에 영향을 줄 주장 하나를 고릅니다. 원출처와 대조하거나 계산을 독립적으로 재현합니다.
- 정확한 주장 식별;
- 인용된 원문 위치 확인;
- 원문이 실제로 주장을 말하는지 확인;
- 날짜, 적용 범위, 단위와 예외 확인;
- verified, contradicted, incomplete, not verifiable 중 하나로 표시.
계산은 모델에게 다시 확인시키지 말고 계산기나 code를 사용합니다. 최신 사실은 원출처를 엽니다. citation이 있다면 실제 존재하고 문장을 뒷받침하는지 확인합니다.
한 건의 성공이 일반 정확성을 증명하지는 않습니다. 그러나 가짜 출처나 근거 없는 중요 주장은 stronger control이 마련될 때까지 높은 신뢰 업무를 BLOCKED로 만들기에 충분합니다.
22–26분: 결과 품질이 아니라 운영 적합성 측정하기
좋은 답변을 만들더라도 제품이 운영에 맞지 않을 수 있습니다.
다음을 확인합니다.
- input·output limit;
- 데이터 처리와 workspace control;
- 공유와 권한 모델;
- export와 portability;
- integration 난이도;
- 사용량과 billing 가시성;
- retry 동작과 rate limit;
- 사람 승인 위치;
- 장애 시 fallback;
- 승인 결과 하나당 예상 검토 시간.
시험 결과의 전체 작업량을 적습니다.
| 비용 항목 | 관찰값 |
|---|---|
| 설정과 prompt 시간 | |
| 도구 처리 시간 | |
| 사람 검토·수정 | |
| 추가 사실 검증 | |
| export 또는 handoff | |
| 실패 시도 |
생성에서 3분을 줄였지만 검증에 15분이 더 필요하면 해당 업무에서는 효율 향상이 아닙니다.
26–29분: 단순 baseline과 비교하기
현재 방식으로 같은 업무를 실행하거나 합리적으로 추정합니다. baseline은 수작업, template, 검색 도구, 기존 구독 또는 작은 model일 수 있습니다.
중요한 차원만 비교합니다.
- 승인 결과 품질;
- 전체 완료 시간;
- 검토자 작업량;
- 오류 발견 가능성;
- 개인정보·권한 적합성;
- 운영 비용;
- portability;
- 실패 복구.
모든 항목에서 AI가 이겨야 하는 것은 아닙니다. 해당 업무에 허용 가능한 trade-off를 정합니다.
현재 방식이 비슷한 노력과 더 낮은 위험으로 요구를 충족하면 기능이 많다는 이유로 도입하지 않습니다.
29–30분: 범위가 제한된 결정 기록하기
결론은 시험 범위를 넘지 않아야 합니다.
나쁜 결론:
우리 회사에 가장 좋은 AI 도구다.
더 나은 결론:
2026-07-20 기준 시험한 plan은 비민감 문서 요약 사례에서 구조 기준을 충족했지만 source verification과 workspace export는 긴 pilot이 필요하다. 상태: 이 업무에 한정한 CANDIDATE.
다음을 기록합니다.
- PASS, CANDIDATE 또는 BLOCKED;
- 정확한 시험 구성;
- 근거와 실패 사례;
- 미해결 질문;
- 다음 시험 담당자와 날짜;
- 결정을 되돌릴 조건.
이 screening의 PASS는 다음 평가 단계로 이동할 수 있다는 뜻일 뿐 production 승인으로 해석하지 않습니다.
30분 평가표
| 시간 | 시험 | 필요한 증거 | 중단 조건 |
|---|---|---|---|
| 0–3분 | 업무·승인 기준 | 한 문장 업무, 검토자, 실패 경계 | 목표를 관찰·측정할 수 없음 |
| 3–6분 | 제품 범위 | plan, mode, 설정, 날짜 | 시험 구성이 불명확함 |
| 6–13분 | 정상 사례 | 원입력, 출력, 수정 기록 | 필수 결과 또는 통제 누락 |
| 13–18분 | 실패 사례 | 실패 동작과 복구 | 숨은 오류, 위험 행동, 금지 데이터 사용 |
| 18–22분 | 주장 검증 | 원출처 대조 | 중요 주장이 가짜 또는 근거 없음 |
| 22–26분 | 운영 적합성 | 검토 시간, limit, 권한, export | 업무를 통제·handoff할 수 없음 |
| 26–29분 | baseline 비교 | 현재 방식의 동일 업무 결과 | baseline보다 의미 있는 이점 없음 |
| 29–30분 | 결정 기록 | 상태, 근거, 미해결 gap | 결론이 시험 범위를 넘음 |
30분으로 입증할 수 없는 것
짧은 시험은 다음을 입증하지 못합니다.
- 장기 reliability와 uptime;
- 다양한 사용자·언어에서의 성능;
- production volume 동작;
- 전체 개인정보·법률·보안·compliance 적합성;
- 접근성;
- 사고 대응 품질;
- 총 migration 비용;
- model drift와 미래 가격;
- 정교한 공격에 대한 방어;
- 지속적인 생산성 향상.
이 질문은 범위가 정해진 pilot, 대표 dataset, 독립 검토, 필요한 경우 red teaming, 운영 monitoring과 정기 재평가가 필요합니다.
짧은 평가 체크리스트
- 반복 업무 하나와 검토자 한 명을 정한다.
- 최소 승인 기준과 즉시 중단 조건을 쓴다.
- 정확한 plan, model·mode, tool, 설정과 날짜를 기록한다.
- 비민감 대표 정상 사례를 사용한다.
- 현실적인 실패 또는 edge case 하나를 실행한다.
- 중요 주장 또는 계산 하나를 독립 검증한다.
- 수정·검증 시간을 측정한다.
- 권한, 데이터 처리, export와 fallback을 확인한다.
- 현재 baseline과 비교한다.
- 해당 업무에 한정해 PASS, CANDIDATE 또는 BLOCKED를 기록한다.