EVALUATION REPORT AI 고객상담 Agent 평가 결과 보고서 주요 평가 결과와 개선 과제를 중심으로 정리한 보고 자료 (주)네피리티 2026-07-24 EXECUTIVE SUMMARY 핵심 요약 평가 결과와 주요 개선 사항을 중심으로 핵심 내용을 정리했습니다. 테스트 결과 핵심 정책 문의에 대한 답변 정확도와 응답 구조의 일관성이 전반적으 로 개선되었습니다. 다만 복수 조건이 포함된 문의에서는 검색 결과와 최종 답변 간의 연결 기준을 추가 로 보완할 필요가 있습니다. 전체 테스트 평가 방식 종합 상태 100건 LLM 개선 기존 평가 데이터셋을 동일한 조 건으로 적용했습니다. Judge 주요 정책 문의의 응답 안정성이 높아졌습니다. 자동 평가 후 개발 담당자가 결 과를 검수했습니다. METHODOLOGY 평가 진행 방식 동일한 테스트 데이터를 기준으로 응답 생성부터 검수까지 진행했습니다. STEP 01 STEP 02 STEP 03 STEP 04 질문 입력 응답 생성 자동 평가 담당자 검수 기존 테스트 데이터셋 구축된 상담 Agent가 LLM as a Judge 방 개발 담당자가 자동 판 의 질문을 입력합니다. 최종 답변을 생성합니 식으로 응답을 판정합 정 결과를 확인합니다. 다. 니다. KEY FINDINGS 주요 평가 결과 평가 과정에서 확인된 개선점과 추가 검토 사항입니다. 개선 확인 개선 확인 답변 구조의 일관성 향상 정책 근거 활용 강화 문의 유형에 따라 필요한 정보를 먼저 정책과 FAQ 검색 결과를 기반으로 답 확인하고 관련 정책을 안내하는 흐름이 변하는 비율이 높아졌으며 임의 판단 이전보다 안정적으로 적용되었습니다. 가능성이 감소했습니다. 추가 검토 추가 검토 복합 문의 검색 기준 예외 상황 응답 기준 여러 조건이 동시에 포함된 문의에서는 일반 정책으로 처리하기 어려운 예외 핵심 검색어가 충분히 생성되지 않는 상황에 대해서는 이관 및 추가 질문 기 사례가 확인되었습니다. 준을 명확히 할 필요가 있습니다. D E TA I L R E S U LT S 문제 유형별 개선 방향 구분 확인된 문제 개선 방향 우선순위 검색 복합 조건 검색어 생성 부족 문의 핵심 조건을 분리해 검색어에 반영 높음 응답 일부 답변의 설명이 길어짐 핵심 안내와 추가 설명을 분리 중간 정책 예외 조건의 근거 부족 정책 문서의 예외 처리 기준 보완 높음 운영 이관 조건의 표현 차이 공통 이관 규칙을 모든 응답에 적용 중간 INSIGHTS 주요 발견과 후속 조치 KEY FINDING REVIEW POINT 답변 생성보다 검색 품질이 중요 검색 실패 시 임의 답변 위험 최종 답변 모델의 성능뿐 아니라 필 적절한 검색 결과가 없는 경우 고정 요한 정책 정보가 검색 결과에 포함 안내 또는 이관 기준이 안정적으로 되는지가 전체 정확도에 큰 영향을 적용되어야 합니다. 주었습니다. NEXT ACTION 검색 기준과 예외 처리 규칙을 우선 보완 복합 문의의 검색어 생성 기준을 정교화하고, 검색 결과가 없거나 부적합한 경우의 응 답 및 이관 기준을 통합합니다. 결론 현재 상담 Agent는 핵심 정책 문의에 대해 이전보다 안정적인 답변 흐름을 제공하 는 것으로 확인되었습니다. 향후에는 복합 문의 검색과 예외 상황 처리 기준을 중심으로 보완해 전체 응답 정확 도와 운영 안정성을 높일 필요가 있습니다.