Skill을 위한 프롬프팅
프롬프트 테스트와 검증
conceptedited by Cairni · 방금 · AIv1
프롬프트를 완성했다고 해서 끝이 아니다. "이 프롬프트가 정말 잘 작동하는가?"를 검증하는 과정이 기술적으로 만족할 만한 Skill과 단순한 일회성 프롬프트를 구분하는 핵심 차이다. conversation
3가지 검증 방법
1. 사람이 평가하기 (Human Evaluation)
가장 확실한 방법으로, 세 가지 방식으로 나뉜다. conversation
A. 한 번 사용해보고 평가
프롬프트를 한두 번 써본 후 아래 항목을 확인한다:
- 결과가 원하는 수준인가?
- 어디가 부족한가? (3가지 구체적으로)
- 손으로 고쳐야 할 부분이 얼마나 되는가? (%)
- 같은 방식으로 다시 쓸 것이라면, 이 프롬프트를 저장할 것인가?
B. 다양한 상황에서 여러 번 테스트
같은 프롬프트로 3~5회 다른 입력값을 넣어 테스트한다. 이후 다음 질문을 확인한다:
- 모든 결과가 일관성 있게 나왔는가?
- 어느 상황에서는 잘 되고 어디서는 안 되는가?
C. 다른 사람이 평가
프롬프트가 어느 정도 완성되면 동료에게 사용해보게 하여 다음을 확인한다:
- 설명이 명확하게 전달되는가?
- 같은 결과가 나왔는가?
- 무엇이 부족한가?
2. 정량 기준으로 평가 (Metrics)
사람 평가는 주관적이므로 객관적 기준을 함께 사용한다. conversation
| 지표 | 측정 방법 | 예시 |
|---|---|---|
| 정확성 | AI 결과가 입력 데이터와 얼마나 일치하는가? | 누락·오류 여부 |
| 완성도 | 요청한 모든 항목이 포함되었는가? | 5개 섹션 요청 시 5개 모두 있는가? |
| 형식 준수 | 요청한 형식대로 나왔는가? | 마크다운·표 등 |
| 일관성 | 같은 프롬프트를 여러 번 써도 동일한 품질인가? | 매번 같은 수준인가? |
| 효율성 | 손으로 고쳐야 할 부분이 얼마나 되는가? (%) | 80% 이상 바로 쓸 수 있는가? |
실전 정량 평가 예시 (회의록 프롬프트, 3회 테스트)
AI · 출처 클릭
테스트1 — 정확성100
테스트1 — 완성도100
테스트1 — 효율성90
테스트2 — 정확성95
테스트2 — 완성도100
테스트2 — 효율성85
테스트3 — 정확성90
테스트3 — 완성도80
테스트3 — 효율성70
분석 결과: conversation
- 평균 — 정확성 95%, 완성도 93%, 형식 100%, 효율성 82%
- 강점 — 형식 준수가 매우 안정적
- 약점 — 기술 용어가 많은 회의에서 이해도 저하
- 개선 방안 — 프롬프트에 "기술 용어는 쉬운 한국어로 설명해달라" 추가
3. AI 기반 평가 (LLM as a Judge)
다른 AI에게 결과물을 평가하게 하는 자동화 방식이다. 대량의 프롬프트를 테스트할 때 유용하다. conversation
평가 프롬프트 구조:
- 1.원래 프롬프트와 AI 결과물을 제공
- 2.다른 AI에게 각 기준(정확성, 완성도, 형식 준수, 가독성)에 대해 0~100점 채점 요청
- 3.각 기준마다 점수와 간단한 이유를 받음
장단점 비교
| 장점 | 단점 |
|---|---|
| 빠르고 일관성 있음 | 사람이 원하는 바를 100% 파악하지 못할 수 있음 |
| 대량 테스트 가능 | 미묘한 품질 차이를 감지하지 못함 |
| 비용 효율적 | 객관성이 완벽하지 않음 |
언제 쓸까: 대량 자동 평가가 필요할 때. 단, 최종 검증은 반드시 사람이 해야 한다. conversation
이 방법에 대한 더 자세한 내용은 LLM 기반 프롬프트 평가를 참고한다.
프롬프트 검증 체크리스트
좋은-프롬프트의-6가지-원칙을 적용한 프롬프트를 완성했을 때 아래 체크리스트로 최종 확인한다. conversation
입력 단계
- 프롬프트가 명확한가? (모호한 부분 없음)
- 프롬프트가 구체적인가? (구체적 예시 포함)
- 형식을 정확하게 명시했는가?
- 제약 조건이 명확한가? (하면 안 되는 것)
출력 단계
- AI 결과가 요청과 일치하는가?
- 빠진 정보가 있는가?
- 잘못된 정보가 있는가?
- 형식이 맞는가?
- 효율성이 높은가? (손으로 고쳐야 할 부분이 적은가?)
반복성 단계
- 같은 프롬프트를 여러 상황에서 써도 일관성이 있는가?
- 어떤 상황에서 잘 되고 어디서는 안 되는가?
- 특정 주제나 데이터 형식에서만 약한가?
실전성 단계
- 다른 사람도 이 프롬프트를 이해하고 쓸 수 있는가?
- 주기적으로 반복할 작업인가? (그렇다면 템플릿으로 저장)
- 팀이 쓸 경우 더 명확하게 작성되어 있는가?
단계별 검증 가이드
| 단계 | 소요 시간 | 주요 활동 |
|---|---|---|
| 0단계 | 5분 | 한 번 써보기, 결과 괜찮은지 판단 |
| 1단계 | 15분 | 2~3번 추가 테스트, 일관성·형식 확인 |
| 2단계 | 30분 | 5회 이상 다양한 상황 테스트, 정량 지표 평가, 약점 파악 |
| 3단계 | 30분 (선택) | 다른 사람 테스트, 피드백 수렴, 최종 수정 |
| 4단계 | 5분 | 검증 완료 후 저장(Notion·스프레드시트 등), 팀 공유, 업데이트 계획 |
이 단계는 반복 개선 프레임워크와 함께 활용하면 효과적이다.
검증 결과 기록 예시
반복 사용할 프롬프트라면 검증 결과를 아래 형식으로 기록해둔다. conversation
프롬프트 이름: 회의록 정리 프롬프트
생성 날짜: 2026년 7월 22일
마지막 수정: 2026년 7월 23일
[검증 결과]
테스트 횟수: 5회
평균 정확성: 94%
평균 효율성: 85% (15% 정도 손으로 수정 필요)
[강점]
- 형식 준수: 매우 일관성 있음
- 기본 정보 추출: 거의 빠짐없음
[약점]
- 기술/업계 용어가 많으면 정확도 ↓
- 참석자가 많으면 이름 혼동 발생
[언제 쓰기 좋은가]
- 마케팅팀, 영업팀 회의
- 20명 이하 참석자
- 산업별 용어가 많지 않은 회의
[주의사항]
- 기술팀 회의에는 별도 프롬프트 필요
- 참석자 이름을 프롬프트에 미리 제공하면 더 정확
[다음 개선 사항]
- "기술 용어는 쉽게 설명해" 추가
- "참석자: [이름]" 명시 요청 추가결론
검증의 핵심 5가지: conversation
- 1.사람이 써봐야 안다 — 1~2회는 필수
- 2.다양한 상황에서 테스트 — 항상 같은 품질인가?
- 3.정량 기준 사용 — "좋다/나쁘다"가 아닌 "92점/74점"
- 4.약한 부분 파악 — 어떤 상황에서 실패하는가?
- 5.기록해두기 — 다음 개선을 위한 근거 확보
이 검증 과정을 거쳐야 "일회성 프롬프트"가 "반복 사용 가능한 Skill"이 된다.