Add PoC #1/#3 execution plan with Go/No-Go criteria

Turns the two highest-priority open risks (on-device tone realism,
impersonation/trust acceptance) into runnable protocols: sample
collection, blind evaluation, role-play scripts, and pass/fail
thresholds, so results can update decision-log.md and risk-log.md.
This commit is contained in:
Claude 2026-07-29 07:28:33 +00:00
parent 2312cbfff1
commit bda759010a
No known key found for this signature in database
2 changed files with 86 additions and 2 deletions

View File

@ -106,6 +106,7 @@
4. [`risk-log.md`](./risk-log.md) — 회의 자료 §2-6, §oslayer §4의 리스크를 완화 상태와 함께 추적
5. [`roadmap.md`](./roadmap.md) — L0~L4 단계, 자체 앱→OS 레이어 확장 시점 반영
6. [`decision-log.md`](./decision-log.md) — Q1~Q7 결정과 근거, 계속 누적 기록
7. [`poc-plan.md`](./poc-plan.md) — PoC #1(말투 학습)·#3(사칭/신뢰 수용성) 실행 계획과 Go/No-Go 기준
## 8. 다음 액션 체크리스트
@ -113,7 +114,9 @@
- [x] Vision Doc 작성 — `vision.md`
- [x] MVP 시나리오 확정 (읽씹 종결 + 단톡 따라잡기) — `PRD.md`
- [x] PRD, 기술 설계서, 리스크 로그, 로드맵 작성
- [ ] §4의 기술 PoC 중 1번(말투 학습)과 3번(사칭/신뢰 수용성) 먼저 진행 — 아직 코드/실사용 검증 없음
- [x] §4의 기술 PoC 중 1번(말투 학습)과 3번(사칭/신뢰 수용성) 실행 계획서 작성 — `poc-plan.md`
(계획만 작성됨, 실제 참가자 모집·데이터 수집·인터뷰는 아직 실행 전 — `poc-plan.md` §4 참고)
- [ ] PoC #1·#3 실제 실행 (참가자 모집, 대화 샘플 수집, 역할극 인터뷰) 및 Go/No-Go 판정
- [ ] 클릭 가능한 프로토타입(Figma 등) 제작, 뱃지·거부권 UX 포함
- [ ] 5~10명 대상 유저 인터뷰로 "AI 대리 응답 수용성"(Q3) 검증
- [ ] 5~10명 대상 유저 인터뷰로 "AI 대리 응답 수용성"(Q3) 검증 (PoC #3와 통합 진행 가능)
- [ ] 실제 회의에서 이 문서 세트 전체를 리뷰하고 Q1~Q7을 정식 확정

81
docs/poc-plan.md Normal file
View File

@ -0,0 +1,81 @@
# PoC 실행 계획 — #1 온디바이스 말투 학습 · #3 사칭/신뢰 수용성
`risk-log.md` 우선순위에 따라 이 두 PoC가 가장 시급하다: 이게 무너지면 나머지 기획(PRD, 로드맵)은
의미가 없다. 이 문서는 팀이 바로 실행할 수 있는 수준까지 방법론을 구체화한다. 실행 자체(실제 대화
데이터 수집, 참가자 인터뷰)는 이 문서 작성 시점에는 아직 이루어지지 않았다 — 다음 액션은 §4 참고.
## PoC #1 — 온디바이스 말투 학습이 "나답게" 느껴지는가
### 목적
`vision.md`의 핵심 가치제안("나 대신 나답게 응답")이 성립하는지 최소 비용으로 먼저 확인한다.
이게 실패하면 자율성 단계(L0~L2)나 신뢰 장치 설계는 전부 무의미해진다.
### 방법
1. **샘플 수집**: 참가자 3~5명당 최근 대화 50~100개(카카오톡 내보내기 등) 확보. 민감한 대화는
참가자가 직접 제외하도록 안내 (연구 목적 최소 수집 원칙, `tech-design.md` §5와 동일한 원칙 적용)
2. **분리**: 대화의 80%는 "학습용"(말투 특징 추출), 20%는 "평가용"(실제 있었던 대화지만 분신
응답과 비교하지 않고 감춰둔 답)으로 나눈다
3. **응답 생성**: 평가용 대화의 상대방 메시지에 대해 분신이 응답 초안을 생성
4. **블라인드 평가**: 참가자 본인과, 참가자를 잘 아는 지인 1~2명에게 "실제 답장 vs 분신 초안"을
섞어서 보여주고 구분 가능한지 + "내(그의) 말투 같다"를 5점 척도로 평가
### 평가 기준 (Go/No-Go)
| 지표 | 기준 |
|---|---|
| "말투 같다" 평균 점수 | 4/5 이상 |
| 실제 답장과 분신 초안을 구분 못하는 비율 | 40% 이상 (완전히 구분 안 되길 기대하지 않음 — 어색하지만 않으면 됨) |
| 명백히 "이상하다"는 반응 비율 | 10% 미만 |
기준 미달 시: `vision.md`의 가치제안 자체를 재검토하거나, 온디바이스 학습 방식(특징 추출 방식,
학습 데이터량)을 먼저 개선하고 재시도. 재시도 없이 다음 단계(PRD 구현)로 넘어가지 않는다.
### 필요한 것
- 참가자 3~5명 (내부 팀/지인으로 충분, 이 단계는 소규모 신호 확인이 목적)
- 응답 초안 생성기 (이 세션에서는 프로토타입 수준 — 실제 온디바이스 모델이 아니어도, LLM 프롬프트에
말투 특징을 주입하는 방식으로 초기 신호를 얻을 수 있음. 배터리/성능 검증은 이 PoC의 범위가 아님)
- 블라인드 평가지 (설문 형태, 5점 척도 + 자유 코멘트)
## PoC #3 — 사칭/신뢰 수용성 (분신 뱃지·거부권 UX)
### 목적
`decision-log.md` Q4("사칭 우려 대응 충분한가?")는 아직 가설이다. 뱃지·거부권·확정 불가 원칙이
실제로 상대방의 신뢰를 지키는지, 설계 문서 밖에서 확인한다.
### 방법
1. **역할극 시나리오 스크립트 작성**: `PRD.md` §2.2 읽씹 종결 흐름을 그대로 재현하는 대화 스크립트
3~4종 (일반적인 안부, 업무 문의, 약속 잡기 시도, 감정적인 대화 — 에스컬레이션 되어야 하는 경우 포함)
2. **참가자 역할**: "상대방" 역할 참가자 5~10명에게 위 시나리오로 분신과 대화하게 함 (Wizard-of-Oz
방식 — 실제 자동 응답 시스템 없이 사람이 분신 역할을 대신 수행해도 됨, 이 단계에서는 UX/신뢰
반응만 측정)
3. **관찰 포인트**:
- 뱃지를 보고 "이건 AI구나"를 즉시 인지하는가
- "본인이야 분신이야?" 질문을 자연스럽게 던지는가, 던졌을 때 답변에 만족하는가
- 거부권("본인이랑만 얘기하고 싶다")을 실제로 쓰고 싶어지는 순간이 있는가, 그 요청이 잘 반영됐다고 느끼는가
- 약속/금전 얘기가 나왔을 때 분신이 보류하는 것에 대한 반응 (안심 vs 답답함)
4. **사후 인터뷰**: "이 대화가 불편했는가", "다음에도 이 사람의 분신과 대화하고 싶은가" 개방형 질문
### 평가 기준 (Go/No-Go)
| 지표 | 기준 |
|---|---|
| 뱃지 인지율 | 90% 이상 (인지 못하면 투명성 설계 자체가 실패) |
| "불편했다" 응답 비율 | 20% 미만 |
| 거부권 사용 의사 있었는데 실제로 못 쓴 경우 | 0건 (UX 결함으로 간주) |
기준 미달 시: `PRD.md` §3.1의 투명성 관련 기능(뱃지 표현, 본인확인 응답 문구, 거부권 노출 위치)을
먼저 개선. 이 PoC는 반복 가능해야 하므로 스크립트는 재사용 가능한 형태로 `docs/poc-plan.md`에 계속
누적한다.
## 결과를 문서에 반영하는 방법
두 PoC 모두 결과가 나오면:
1. `decision-log.md`의 해당 Q(Q3, Q4)를 "제안" → "확정" 또는 "재검토 필요"로 갱신
2. Go 판정이면 `PLANNING.md` §8 체크리스트에 완료 표시
3. No-Go면 `risk-log.md`에 구체적 실패 모드를 새 리스크 행으로 추가하고, 재시도 계획을 이 문서에 추가
## 다음 액션 (이 문서 작성 다음 단계)
- [ ] PoC #1: 참가자 3~5명 확보 + 대화 샘플 수집 동의
- [ ] PoC #1: 응답 초안 생성 프로토타입 준비 (LLM 프롬프트 기반 초기 버전으로 충분)
- [ ] PoC #3: 시나리오 스크립트 3~4종 확정 (에스컬레이션 케이스 반드시 포함)
- [ ] PoC #3: "상대방" 역할 참가자 5~10명 확보
- [ ] 두 PoC 결과를 `decision-log.md`/`risk-log.md`에 반영