완료 · 기타
상담 로그 지식베이스 부트스트랩
상담 JSONL에서 반복 문의를 찾고 PII를 가린 뒤 근거가 있는 FAQ 초안을 만드는 Codex 플러그인입니다.
현재 상태 설치 가능한 제출물과 오프라인 검증을 완료했습니다. 자동 게시가 아닌 검토 가능한 FAQ 초안 생성 도구로 범위를 고정했습니다.
Verified scope
기여 범위와 확인 근거
- 직접 역할
- 개인 설계·구현·검증
- 근거 공개 범위
- 비공개 원문·공개 가능한 범위만 요약
- 기여 근거
- 골든·적대 테스트
- PII 마스킹 재검색
- FAQ 근거 검증
해결하려는 문제
상담 로그에는 같은 질문과 답변이 표현만 달리해 반복됩니다. 사람이 모든 로그를 읽고 FAQ를 만들면 시간이 오래 걸리고, 자동 요약만 사용하면 서로 다른 정책을 합치거나 개인정보와 근거 없는 숫자를 다시 노출할 수 있습니다. 목표는 게시물이 아니라 사람이 검토할 수 있는 안전한 FAQ 후보를 만드는 것입니다.
경계 설계
LLM은 인접 주제를 의미적으로 병합하고 초안을 작성합니다. 개인정보 마스킹, 숫자·인용의 원문 실존 여부, 게시 가능 판정은 결정론 코드가 담당합니다.
JSONL을 읽은 뒤 전화번호·이메일·식별자 패턴을 먼저 가리고, 결정론 micro-cluster가 명확히 가까운 문의만 묶습니다. AI는 작은 후보 사이의 의미 병합과 문장 초안을 담당하지만 최종 그룹과 답변에는 근거 로그 ID가 남습니다. 게시 전 validator는 인용과 (숫자, 단위)가 근거에 실제로 존재하는지 확인합니다.
왜 정밀도 우선인가
서로 다른 정책을 한 FAQ로 합치는 오병합은 잘못된 상담 지식을 만듭니다. 자동 클러스터링은 보수적으로 유지하고 사람이 검토할 수 있는 작은 후보를 만듭니다.
가상 로그 35건에서 24개 micro-cluster와 6개 FAQ 후보를 만들었고, 기록된 pair precision은 0.82입니다. recall은 0.21로 낮지만 누락된 후보는 사람이 추가할 수 있는 반면 잘못 합쳐진 정책은 사용자에게 잘못된 안내를 줄 수 있어 이 trade-off를 선택했습니다. 적대 테스트 9개와 PII 마스킹 후 재검색에서 검출 0건을 확인했습니다.
한계와 다음 단계
현재 PII 탐지는 패턴 기반이라 자유롭게 쓰인 사람 이름이나 문맥형 개인정보를 모두 찾지 못합니다. 상담 로그를 자동 게시하지 않으며, 더 넓은 개인정보 탐지와 정책 버전 분리를 추가하더라도 사람 승인 단계를 유지합니다.