Skill을 위한 프롬프팅
infograb - LLM 기반 프롬프트 평가
sourceedited by Cairni · 방금 · AIv1
출처 정보
- 출처: InfoGrab 블로그
- 작성자: Harvey (AI DevOps 엔지니어)
- 작성일: 2025년 6월 11일
- 실습 환경: Python 3.12.10
핵심 주장
프롬프트 품질을 정량적으로 측정·개선하지 않으면 주관적 평가에 의존하게 되어 성능 개선이 어렵다. Prometheus 2와 OpenAI API(gpt-4.1) 두 가지 LLM-as-a-judge 도구를 비교 실습하여 각각의 적합한 사용 사례를 제시한다. infograb - LLM 기반 프롬프트 평가
평가 방식 비교
| 방식 | 장점 | 단점 |
|---|---|---|
| 인간 평가 | 신뢰도 높음, 사용자 만족도 반영 | 주관 개입, 비용·시간 소요 |
| 정량 지표 기반 (BLEU, ROUGE 등) | 빠르고 간편 | 맥락 반영 어려움 |
| LLM-as-a-judge | 인간·정량 평가의 한계 보완 | 기준 불명확 시 왜곡, 비용 부담 |
평가 데이터 구조
필요한 4가지 필드: instruction (입력 프롬프트), response (LLM 응답), reference_answer (참고 답변, 선택), rubric_data (평가 기준 + 1~5점 설명).
Prometheus 2 실습 요약
- 모델:
prometheus-eval/prometheus-7b-v2.0(오픈 소스, 절대·상대 평가 지원) - 절대 평가: 잘못된 서버 정보가 포함된 응답에 5점 부여 → 맥락 불일치 탐지 한계 노출
- 환각 탐지: 출시일·가격이 틀린 응답(Claude 4 관련)에 "공식 자료와 완전히 일치"라며 5점 부여 → 오평가
AI · 출처 클릭
환각 탐지 점수 (오평가)
5/5
infograb - LLM 기반 프롬프트 평가
절대 평가 점수 (맥락 불일치)
5/5
infograb - LLM 기반 프롬프트 평가
강점: 저비용, 배치 처리, 문장 구조·맥락 평가 우수 → 문서 작성·요약 프롬프트에 적합 약점: 웹 검색 기반 사실 확인 불가, 다국어 지원 부족
OpenAI API 실습 요약
- 모델:
gpt-4.1,web_search도구 연동 가능 - 절대 평가: 동일 데이터에서 정확한 서버 메트릭·권장 사항 확인 후 5/5 → 타당한 평가
- 환각 탐지: 웹 검색으로 오류 확인 → "수많은 잘못된 날짜·가격 포함", 1점 → 정확한 탐지
- 수정된 정확한 응답 재평가 시 5점으로 상향
AI · 출처 클릭
환각 탐지 점수 (정확한 탐지)
1/5
infograb - LLM 기반 프롬프트 평가
수정 응답 재평가 점수
5/5
infograb - LLM 기반 프롬프트 평가
강점: 우수한 성능, 다국어 지원, 웹 검색 기반 사실 확인·환각 탐지 강점 약점: 토큰 사용량 많아 비용 부담 큼
두 도구 비교
결론 및 권장 사항
- LLM은 APE(Automatic Prompt Engineering) 로 프롬프트 자동 개선 단계까지 진화 중
- 신뢰도 높은 평가를 위해 프롬프트 목적·맥락을 고려한 반복 평가 필수
- 자동화된 프롬프트 평가 파이프라인 구축 권장 → 응답 품질 향상, 운영 비용 절감, 업무 효율 향상
참고 문헌
- Zheng et al., "Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena", 2023, arXiv:2306.05685
- Kim et al., "Prometheus 2", 2024, arXiv:2405.01535
- prometheus-eval GitHub: https://github.com/prometheus-eval/prometheus-eval