5.4 KiB
5.4 KiB
PoC 실행 계획 — #1 온디바이스 말투 학습 · #3 사칭/신뢰 수용성
risk-log.md 우선순위에 따라 이 두 PoC가 가장 시급하다: 이게 무너지면 나머지 기획(PRD, 로드맵)은
의미가 없다. 이 문서는 팀이 바로 실행할 수 있는 수준까지 방법론을 구체화한다. 실행 자체(실제 대화
데이터 수집, 참가자 인터뷰)는 이 문서 작성 시점에는 아직 이루어지지 않았다 — 다음 액션은 §4 참고.
PoC #1 — 온디바이스 말투 학습이 "나답게" 느껴지는가
목적
vision.md의 핵심 가치제안("나 대신 나답게 응답")이 성립하는지 최소 비용으로 먼저 확인한다.
이게 실패하면 자율성 단계(L0~L2)나 신뢰 장치 설계는 전부 무의미해진다.
방법
- 샘플 수집: 참가자 3~5명당 최근 대화 50~100개(카카오톡 내보내기 등) 확보. 민감한 대화는
참가자가 직접 제외하도록 안내 (연구 목적 최소 수집 원칙,
tech-design.md§5와 동일한 원칙 적용) - 분리: 대화의 80%는 "학습용"(말투 특징 추출), 20%는 "평가용"(실제 있었던 대화지만 분신 응답과 비교하지 않고 감춰둔 답)으로 나눈다
- 응답 생성: 평가용 대화의 상대방 메시지에 대해 분신이 응답 초안을 생성
- 블라인드 평가: 참가자 본인과, 참가자를 잘 아는 지인 1~2명에게 "실제 답장 vs 분신 초안"을 섞어서 보여주고 구분 가능한지 + "내(그의) 말투 같다"를 5점 척도로 평가
평가 기준 (Go/No-Go)
| 지표 | 기준 |
|---|---|
| "말투 같다" 평균 점수 | 4/5 이상 |
| 실제 답장과 분신 초안을 구분 못하는 비율 | 40% 이상 (완전히 구분 안 되길 기대하지 않음 — 어색하지만 않으면 됨) |
| 명백히 "이상하다"는 반응 비율 | 10% 미만 |
기준 미달 시: vision.md의 가치제안 자체를 재검토하거나, 온디바이스 학습 방식(특징 추출 방식,
학습 데이터량)을 먼저 개선하고 재시도. 재시도 없이 다음 단계(PRD 구현)로 넘어가지 않는다.
필요한 것
- 참가자 3~5명 (내부 팀/지인으로 충분, 이 단계는 소규모 신호 확인이 목적)
- 응답 초안 생성기 (이 세션에서는 프로토타입 수준 — 실제 온디바이스 모델이 아니어도, LLM 프롬프트에 말투 특징을 주입하는 방식으로 초기 신호를 얻을 수 있음. 배터리/성능 검증은 이 PoC의 범위가 아님)
- 블라인드 평가지 (설문 형태, 5점 척도 + 자유 코멘트)
PoC #3 — 사칭/신뢰 수용성 (분신 뱃지·거부권 UX)
목적
decision-log.md Q4("사칭 우려 대응 충분한가?")는 아직 가설이다. 뱃지·거부권·확정 불가 원칙이
실제로 상대방의 신뢰를 지키는지, 설계 문서 밖에서 확인한다.
방법
- 역할극 시나리오 스크립트 작성:
PRD.md§2.2 읽씹 종결 흐름을 그대로 재현하는 대화 스크립트 3~4종 (일반적인 안부, 업무 문의, 약속 잡기 시도, 감정적인 대화 — 에스컬레이션 되어야 하는 경우 포함) - 참가자 역할: "상대방" 역할 참가자 5~10명에게 위 시나리오로 분신과 대화하게 함 (Wizard-of-Oz 방식 — 실제 자동 응답 시스템 없이 사람이 분신 역할을 대신 수행해도 됨, 이 단계에서는 UX/신뢰 반응만 측정)
- 관찰 포인트:
- 뱃지를 보고 "이건 AI구나"를 즉시 인지하는가
- "본인이야 분신이야?" 질문을 자연스럽게 던지는가, 던졌을 때 답변에 만족하는가
- 거부권("본인이랑만 얘기하고 싶다")을 실제로 쓰고 싶어지는 순간이 있는가, 그 요청이 잘 반영됐다고 느끼는가
- 약속/금전 얘기가 나왔을 때 분신이 보류하는 것에 대한 반응 (안심 vs 답답함)
- 사후 인터뷰: "이 대화가 불편했는가", "다음에도 이 사람의 분신과 대화하고 싶은가" 개방형 질문
평가 기준 (Go/No-Go)
| 지표 | 기준 |
|---|---|
| 뱃지 인지율 | 90% 이상 (인지 못하면 투명성 설계 자체가 실패) |
| "불편했다" 응답 비율 | 20% 미만 |
| 거부권 사용 의사 있었는데 실제로 못 쓴 경우 | 0건 (UX 결함으로 간주) |
기준 미달 시: PRD.md §3.1의 투명성 관련 기능(뱃지 표현, 본인확인 응답 문구, 거부권 노출 위치)을
먼저 개선. 이 PoC는 반복 가능해야 하므로 스크립트는 재사용 가능한 형태로 docs/poc-plan.md에 계속
누적한다.
결과를 문서에 반영하는 방법
두 PoC 모두 결과가 나오면:
decision-log.md의 해당 Q(Q3, Q4)를 "제안" → "확정" 또는 "재검토 필요"로 갱신- Go 판정이면
PLANNING.md§8 체크리스트에 완료 표시 - No-Go면
risk-log.md에 구체적 실패 모드를 새 리스크 행으로 추가하고, 재시도 계획을 이 문서에 추가
다음 액션 (이 문서 작성 다음 단계)
- PoC #1: 참가자 3~5명 확보 + 대화 샘플 수집 동의
- PoC #1: 응답 초안 생성 프로토타입 준비 (LLM 프롬프트 기반 초기 버전으로 충분)
- PoC #3: 시나리오 스크립트 3~4종 확정 (에스컬레이션 케이스 반드시 포함)
- PoC #3: "상대방" 역할 참가자 5~10명 확보
- 두 PoC 결과를
decision-log.md/risk-log.md에 반영