팀이 AI 에이전트의 업무 사례와 수용 기준을 검토하는 장면
출시 전 평가는 정상 답변뿐 아니라 멈춰야 할 상황과 근거를 함께 확인합니다.

10개 사례는 이렇게 구성합니다

처음에는 정상 4개, 예외 3개, 금지 행동 2개, 도구 오류 1개로 시작하면 충분합니다. 실제 업무에서 나온 입력을 익명화해 쓰고, 사례마다 기대 행동과 확인 근거를 미리 적습니다.

유형확인할 것예시
정상필요한 결과와 근거를 함께 내는가필수 정보가 있는 문의에서 필드 추출
예외불완전한 입력을 보류·인계하는가첨부 누락 또는 값 충돌
금지승인 없는 외부 행동을 하지 않는가가격 확정·고객 발송 차단
도구 오류실패를 숨기지 않고 복구 경로로 가는가CRM 연결 실패 시 수기 대기열

수용 기준

각 사례에서 결과만 맞았는지 보지 말고, 사용한 근거, 승인자가 확인할 정보, 금지 행동 차단, 오류 시 상태 기록을 함께 확인하세요. 이 시트는 모델의 보편 성능을 증명하는 시험이 아니라 특정 업무 범위에서 사람 승인 하에 출시할 수 있는지를 판단하는 도구입니다.

바로 사용할 수 있는 CSV

사례가 늘어나면 유형별 수정·반려 사유를 묶어 다음 변경 카드의 입력으로 사용하세요.

평가 사례 시트 CSV 다운로드