Agent Evaluation를 실무 흐름으로 이해하기
AI Agent의 응답 품질, 도구 사용 정확도, 안전성을 정량적으로 평가하는 방법을 정리합니다. Golden Set 구축부터 LLM-as-Judge, 회귀 테스트까지 실무에서 바로 쓰는 평가 체계를 다룹니다. 이 가이드는 개념을 나열하기보다, 실제 프로젝트에서 판단해야 하는 순서대로 내용을 따라갈 수 있게 구성했습니다.
AI Agent의 응답 품질, 도구 사용 정확도, 안전성을 정량적으로 평가하는 방법을 정리합니다. Golden Set 구축부터 LLM-as-Judge, 회귀 테스트까지 실무에서 바로 쓰는 평가 체계를 다룹니다.
AI Agent의 응답 품질, 도구 사용 정확도, 안전성을 정량적으로 평가하는 방법을 정리합니다. Golden Set 구축부터 LLM-as-Judge, 회귀 테스트까지 실무에서 바로 쓰는 평가 체계를 다룹니다. 이 가이드는 개념을 나열하기보다, 실제 프로젝트에서 판단해야 하는 순서대로 내용을 따라갈 수 있게 구성했습니다.
모델과 프롬프트만 보지 않고, 데이터 흐름, 평가, 배포 이후의 운영 지표까지 한 번에 연결해서 봅니다.
글로 읽은 내용을 머릿속에 오래 남기려면 먼저 흐름을 그림으로 잡는 편이 좋습니다. 아래 두 그림은 Agent Evaluation를 학습할 때 계속 되돌아볼 수 있는 기준 지도입니다.
Agent Evaluation를 처음 펼칠 때는 세부 명령보다 큰 그림이 먼저입니다. 이 섹션에서는 앞으로 배울 개념들이 어떤 문제를 풀기 위해 등장했는지부터 잡아봅니다.
Golden Set 구축은 선택지가 갈리는 지점입니다. 표를 기준으로 각 방법의 쓰임새와 운영상의 차이를 비교해두면 이후 판단이 훨씬 쉬워집니다.
| 난이도 | 비중 | 예시 |
|---|---|---|
| 쉬움 (Happy path) | 50% | 표준적인 단일 도구 호출로 해결되는 질문 |
| 보통 (Multi-step) | 30% | 여러 도구를 순서대로 조합해야 하는 질문 |
| 어려움 (Edge case) | 20% | 모호한 질문, 도구가 실패했을 때의 처리 |
정량 평가 지표은 선택지가 갈리는 지점입니다. 표를 기준으로 각 방법의 쓰임새와 운영상의 차이를 비교해두면 이후 판단이 훨씬 쉬워집니다.
| 지표 | 측정 대상 |
|---|---|
| Task Success Rate | 목표를 실제로 달성했는지 여부 |
| Tool Call Accuracy | 올바른 도구를, 올바른 인자로 호출했는지 |
| Faithfulness | RAG 답변이 검색된 근거 문서에 실제로 기반하는지 |
| Latency (p50/p95) | 응답까지 걸린 시간 분포 |
| Cost per task | 작업 하나를 완료하는 데 든 토큰 비용 |
여기서는 LLM-as-Judge을 실제 코드와 함께 확인합니다. 예제를 그대로 따라 하기보다, 입력과 출력, 그리고 바뀌기 쉬운 부분이 어디인지 보면서 읽어보세요.
JUDGE_PROMPT = """다음 Agent 응답을 0~5점으로 채점하세요.
질문: {question}
기대 결과: {expected}
Agent 응답: {actual}
채점 기준:
- 5점: 기대 결과와 사실상 동일, 근거가 명확함
- 3점: 방향은 맞지만 일부 정보 누락/부정확
- 0점: 완전히 틀리거나 근거 없이 답변함
점수만 숫자로 답하세요."""
def judge(question: str, expected: str, actual: str) -> int:
score = call_llm(JUDGE_PROMPT.format(
question=question, expected=expected, actual=actual))
return int(score.strip())이 섹션은 회귀 테스트을 실무 관점에서 정리합니다. 개념을 외우기보다, 어떤 상황에서 이 기준을 꺼내 쓸지에 초점을 맞춰보세요.
이 섹션은 프로덕션 모니터링을 실무 관점에서 정리합니다. 개념을 외우기보다, 어떤 상황에서 이 기준을 꺼내 쓸지에 초점을 맞춰보세요.