AI의 진실¶
LLM 심사 시스템이나 프로그램 기반 규칙이 도입되기 전에는 사람이 직접 결과물을 보고 적합한지 판단했습니다. 이것이 바로 인간 참여형(HITL) 평가 방식입니다.
본질적으로 모든 자동화 평가는 인간의 판단을 모방하려는 시도일 뿐입니다. 팀원들이 “좋은” 평가 기준에 대해 합의하지 못한다면, 어떤 AI 평가자도 정답을 맞출 수 없습니다. 인간의 피드백은 머릿속에 있는 설계 사양을 기계가 따를 수 있는 지침으로 변환하는 과정입니다.
인간 평가가 필요한 경우는 언제인가요?¶
인간은 규모 확장에 한계가 있으므로 전략적으로 활용해야 합니다. 인간이 필요한 주요 시나리오는 네 가지입니다.
주관적 품질: 어조, 공감, 브랜드 보이스는 코드로 구현하기 어렵습니다. 예시: 서점 주인은 휴일 관련 도서 목록은 정확하게 제공하지만, 말투가 “냉정하고 딱딱하다”. 사람은 이러한 냉정함의 부족을 알아차리지만, 규칙에 기반한 검사 방식으로는 알아차리기 어려울 것이다.
중대한 결정: 법률, 의학 또는 금융 분야에서 환각으로 인한 손실은 너무나 큽니다. 안전과 규정 준수를 위해서는 인간의 검토가 필수적입니다.
새로운 실패 유형: 아직 이해하지 못한 문제를 자동으로 감지할 수는 없습니다. 인간은 "실패 가능성 영역"을 탐색하여 궁극적으로 자동화된 평가 도구를 작성하는 데 필요한 직관력을 구축합니다.
보정: 자동 심사 시스템은 모델과 사용자 행동이 변화함에 따라 시간이 지남에 따라 정확도가 떨어질 수 있습니다. AI 심사 시스템이 팀의 기준과 여전히 일치하는지 확인하려면 주기적인 사람의 샘플링이 필요합니다.
내부 피드백 vs. 외부 피드백¶
인간 참여형 프로세스는 단순히 내부 팀이 대시보드만 바라보는 것을 의미하지 않습니다. 다음을 포함합니다.
내부 주석: 팀에서 특정 추론 및 메타데이터를 사용하여 추적 결과를 평가할 수 있습니다.
사용자 의견: 채팅 종료 시 “좋아요/싫어요” 버튼 기능
Latitude를 사용하면 최종 사용자 피드백을 평가 데이터에 직접 통합하여 실제 만족도에서 시스템적 신뢰성으로 이어지는 지속적인 연결 고리를 만들 수 있습니다.
핵심 요점: 인간의 판단력을 활용하여 "이유"를 파악한 다음, 그 통찰력을 바탕으로 자동화 시스템의 "방법"을 구축하십시오.인간 평가 설계¶
소음 문제¶
팀들이 저지르는 가장 큰 실수는 “이 답변에 1부터 5까지 점수를 매겨주세요” 와 같이 모호한 질문을 하는 것입니다 . "품질"에 대한 명확한 정의가 없으면, 어떤 검토자는 사실 정확성을 기준으로 점수를 매기고, 다른 검토자는 간결성을 기준으로 점수를 매길 수 있습니다. 결국 대시보드에는 아무 의미 없는 숫자만 가득하게 됩니다.
유용한 데이터를 얻으려면 기준이 구체적이고, 관찰 가능하며, 객관적이어야 합니다.
채점 방식 선택하기
질문마다 다른 척도가 필요합니다. 과제의 난이도에 맞춰 척도를 조정하세요.
이진법(합격/불합격): 명확하고 객관적인 요구 사항에 가장 적합합니다. (예: “상담원이 고객의 이름을 사용했습니까?” )
리커트 척도(1-5): 유용성이나 미묘한 차이와 같은 성공 정도를 측정하는 데 가장 적합합니다.
꿀팁: 각 숫자가 의미하는 바를 명확히 정의하세요. 단순히 "3은 평균이다"라고만 하지 말고, "3은 주요 질문에 대한 답은 얻었지만, 중요한 세부 사항을 놓쳤다는 의미입니다"라고 설명하세요.
메타 데이터의 힘¶
점수는 문제가 있음 을 알려주고 , 메타데이터는 문제의 내용 을 알려줍니다 . Latitude에서는 모든 주석에 문제 발생 이유를 기록하는 필드가 포함되어 있습니다.
논리적 근거를 절대 생략하지 마세요. * 점수: 2/5 (모호함)
메타데이터: “담당자가 품절된 책을 추천했고, 특별 주문 요청을 처리하지 않았습니다.”
이 메모는 나중에 자동화된 LLM-as-Judge를 구축하여 이러한 오류 유형을 정확히 포착할 수 있도록 해주는 "핵심"입니다 . 오늘 10초만 더 투자하여 "원인"을 기록해 두면 내일 디버깅에 소요되는 시간을 몇 시간이나 절약할 수 있습니다.
성공을 위한 요약
해석의 여지가 없도록 구체적인 평가 기준을 정의하십시오 .
필요한 세분화 수준에 맞는 채점 방식을 선택하세요 .
모든 주석에 대한 근거를 기록하세요 .
평가 기준을 여러 사람에게 테스트하여 의견 일치를 확인한 후, 등급을 조정하십시오.
주석에서 패턴으로¶
신뢰성의 원료¶
50~100개의 추적 데이터를 검토하고 나면, 단순히 점수가 적힌 스프레드시트를 보는 것이 아니라 자동화 전략의 청사진을 보게 되는 것입니다. 개별 오류는 무작위로 발생하는 것처럼 보이지만, 전체적으로 살펴보면 특정 유형의 오류가 집중적으로 발생하는 것을 알 수 있습니다 .
이슈 디스커버리 는 점수가 낮은 트레이스들을 그룹화하여 공통점을 찾는 과정입니다.
주제 클러스터: 서점 주인은 틈새 장르에 대한 질문을 받을 때 일관되게 제대로 답변하지 못하는가?
상호작용 유형: 고객이 불만을 느낄 때 특히 어조가 달라지는가?
형식 클러스터: 특정 재고 점검 중에 도구 호출이 실패합니까?
자동화로 가는 다리¶
인간의 평가 목표는 궁극적으로 특정 고장 모드에 대해 인간의 개입이 불필요해지도록 하는 것입니다. 인간의 판단은 문제를 찾는 데 사용되고, 자동화된 평가는 해결책을 확장하는 데 사용됩니다.
나만의 황금 데이터셋 구축하기
주석을 단 트레이스, 특히 “정상” 출력값이 무엇이어야 하는지 정확하게 정의한 트레이스는 이제 골든 데이터셋이 됩니다 . 이렇게 선별된 데이터셋은 프롬프트를 업데이트하거나 모델을 교체할 때마다 오프라인 회귀 테스트에 사용됩니다.
이슈의 생명주기¶
정상적인 AI 제품에서는 모든 문제가 동일한 궤적을 따라 진행됩니다.
인간의 발견: 한 사람이 새로운 유형의 오류를 발견했습니다.
인간의 정의: 이 특정 사례에서 "좋음"이 무엇을 의미하는지는 당신이 정의합니다.
자동화: 해당 정의를 자동화된 평가 도구로 인코딩합니다.
모니터링: 자동화 시스템이 작동을 시작하고, 담당자는 다음으로 발생할 수 있는 고장 유형을 찾아내는 데 집중합니다.
효율성 향상 팁: Latitude 플랫폼에서는 문제 발견이 자동으로 지원됩니다. 시스템이 이러한 패턴을 자동으로 표시해 주므로, 로그를 수동으로 분류하는 대신 어떤 패턴이 중요한지 판단하는 데 시간을 집중할 수 있습니다.전체적인 그림¶
인간 참여형 프로세스는 발견 메커니즘이고, 자동화된 평가는 확장 메커니즘입니다. 이 과정을 따르면 AI 제품이 데모 환경에서만 작동하는 것이 아니라 수천 명의 사용자에게 확장될 때에도 안정적으로 작동하도록 보장할 수 있습니다.