5.8 KiB
PoC #1 기반 코퍼스 — AI-Hub 한국어 SNS 멀티턴 대화
docs/poc-plan.md의 PoC #1(온디바이스 말투 학습)에서, 개인화 레이어를 얹기 전 기반 톤 생성
모델을 학습/평가할 코퍼스로 AI-Hub "한국어 SNS 멀티턴 대화" 데이터셋을 사용한다. 이 데이터는
특정 개인의 말투가 아니라 익명 화자쌍의 일반 대화이므로, PoC #1의 "내 말투 같다" 개인화 검증
자체를 대체하지는 않는다 — 개인화 검증은 여전히 실제 참가자의 대화 샘플이 필요하다
(docs/poc-materials.md §1 참고).
사용법
python3 prepare_dataset.py --input <원본 zip이 있는 디렉토리> --output <출력 디렉토리> [--qa]
--input: AI-Hub에서 내려받은TS_*.zip/TL_*.zip(학습)·VS_*.zip/VL_*.zip(검증) 원본 파일이 있는 디렉토리. 파일명에VL_/TL_이 포함된 zip(라벨링 JSON)만 읽는다 — 여기에 발화 텍스트와 화행(speech_act)·슬롯 라벨이 모두 있어서VS_/TS_(원천 CSV)는 출력에 필요 없다.--output:train.jsonl,val.jsonl,stats.json을 쓸 디렉토리.--qa: 원천 CSV의 대화ID와 라벨 JSON의 대화ID를 교차검증해서 커버리지 차이를 출력.
실행 결과 (2026-07-29, 이 세션에서 실제로 돌려본 값)
- 총 142,575건 (학습 122,951 / 검증 19,624), 평균 발화 16.5턴/대화
- 주제 9종, 정치(3,242건)·경제및사회(4,257건)가 다른 주제(1.7만~2.2만건)보다 훨씬 적음 — 주제별 균형이 필요하면 샘플링 시 감안할 것
- 화자 연령/성별 필드 노이즈 81건은 정제 과정에서
null로 치환 (버리지 않고 필드만 비움) - QA 결과: 원천(CSV) 쪽에는 라벨링된 142,575건 외에 34,030건이 더 있음 (라벨 없이 텍스트만). 화행/슬롯 라벨이 필요 없는 순수 언어모델링 목적이라면 이 34,030건도 추가로 끌어올 수 있다 — 다만 이번 스크립트는 라벨 JSON만 다루므로 추가 파서가 필요함 (아직 안 만듦)
응답 초안 생성기 (generate_draft.py)
PoC #1의 "응답 초안 생성" 단계를 채우는 프로토타입. 말투 예시(그 사람이 쓴 문장 몇 개) +
최근 대화 맥락을 받아서, tech-design.md §2의 서버 LLM 폴백 경로처럼 LLM 호출로 답장 초안
하나를 만든다. 확정성 있는 내용(금전·약속·감정 이슈)은 [ESCALATE]를 출력하도록 시스템
프롬프트에 못박아뒀다 — AGENTS.md의 절대 안전선을 프롬프트 레벨에서도 지키기 위함.
pip install -r requirements.txt
export GEMINI_API_KEY=...
python3 generate_draft.py --style style_examples.txt --context context.txt
Gemini(google-genai)를 쓴다 — 기본 모델은 --model로 바꿀 수 있고 기본값은
gemini-2.5-flash. GEMINI_API_KEY가 없으면 실제 전송될 프롬프트만 stdout에 찍고 끝난다.
이 세션에는 그 키가 없어서, 실제 호출 대신 이 코퍼스의 실제 대화 하나로 프롬프트 구성만
확인하고 초안은 직접 사람이 작성해 아래처럼 대조해봤다.
GEMINI_API_KEY는 어디에 설정하나
- 권장: 저장소 루트
.env에GEMINI_API_KEY=...를 넣는다 (템플릿은.env.example).generate_draft.py가 실행 시 이 파일을 읽는다..env는.gitignore로 커밋되지 않는다. - 대안: 터미널에서
export GEMINI_API_KEY=...(임시) 또는 셸 프로필에 등록. Google AI Studio에서 발급한 키를 그대로 쓰면 된다. - 이 Claude Code 세션/환경에서 직접 실행해보고 싶다면: 이 대화창에
export GEMINI_API_KEY=실제키를 실행해달라고 하면 되는데, 그러면 키 값이 이 대화 기록에 그대로 남는다 — 무제한 결제 키가 아니라 사용량 제한을 걸어둔 테스트용 키를 쓰는 걸 권장한다. 대화 기록에 남기고 싶지 않다면, 이 환경(Claude Code on the web)의 환경설정에서 환경변수로 등록하는 방법도 있다 — 다만 이미 실행 중인 이 세션에 즉시 반영되는지는 환경 재시작이 필요할 수 있어 확실치 않다.
샘플 검증 (검증셋 id=003820, "고교학점제" 대화, B의 마지막 답장을 가리고 앞 6개 발화만
스타일 예시로 사용):
- 실제 답장:
ㅋㅋ 내가 지금 말한 거 고교학점제 홈피에 다 있는 내용이니까 궁금하면 가서 더 찾아봐랑!ㅋ - 생성 초안(수동):
ㅋㅋㅋ 뭘 유식까지야, 그냥 관심있어서 좀 찾아본거임 너도 궁금하면 고교학점제 사이트 가서 찾아봐~ㅋ - 둘 다 "ㅋㅋ로 시작 → 정보 제공자 역할 수용 → '찾아봐'식 권유형 마무리 → ㅋ로 끝" 패턴이 겹침.
다만 이건 익명 화자의 일반 대화 스타일 재현 여부를 본 것일 뿐, 실제 개인화("이 사람 말투 같다")
검증은 아니다 — 그건
poc-materials.md의 실제 참가자 데이터로만 확인 가능하다.
반드시 지킬 것
- 원본 zip과 이 스크립트의 출력(JSONL)을 git에 커밋하지 않는다. AI-Hub 데이터는 이용약관상
제3자 재배포가 제한되고, 용량도 수백MB~1GB라 저장소에 맞지 않는다. 저장소 루트의
.gitignore에poc/tone-corpus/data/가 등록되어 있으니 원본·출력은 그 아래에 두고 작업할 것. - 이 저장소는 기획 문서 전용이라, 이 스크립트도 "PoC 도구"로만 취급한다 — 여기서 앱 코드/프레임워크로
확장하지 않는다 (
AGENTS.md참고). - 실제 모델 학습에 쓰기 전에, 이 데이터가 세션이 아닌 영구 저장소(본인 로컬/스토리지)로 옮겨졌는지 확인할 것 — 클라우드 세션은 종료되면 임시 파일이 사라진다.