같은 대화에서 순한맛과 매운맛이 다른 말을 하는 이유는 정확도가 달라서가 아닙니다. 서비스가 AI에게 요청하는 관점과 말투가 다르기 때문입니다.
파일에서 요청까지
본성 탈곡기는 날짜와 시간 표기를 제거하고 같은 발화자의 연속 메시지를 합칩니다. 합친 뒤 마지막 3,000줄까지 서버를 거쳐 Gemini로 보냅니다. 이 과정에서 시간 간격 정보가 빠지므로 “몇 시간 동안 답을 안 했다”는 계산의 근거는 전달되지 않습니다.
사실 추출과 문장 생성은 다릅니다
가상 대화 “가: 어디서 볼까? / 나: 네가 정해”에서 장소를 고르는 역할은 관찰할 수 있습니다. 그러나 “나는 관계에 관심이 없다”는 내용은 원문에 없습니다. AI가 이런 해석을 덧붙일 수 있으므로 자연스러운 문장이라고 해서 사실로 받아들이면 안 됩니다.
모드를 비교할 때 볼 것
순한맛은 같은 장면을 배려나 수용으로, 매운맛은 소극성으로 표현할 수 있습니다. 두 결과에서 공통으로 지적한 행동을 찾아 원문과 대조해 보세요. 말투만 다르면 관점의 차이이고, 없던 사건이나 수치가 추가됐다면 근거가 부족한 내용입니다.
검증 가능한 코멘트 사용법
결과 옆에 근거 문장을 하나씩 적어보세요. 근거가 없는 항목은 공유하지 말고, “이 부분에서는 내가 질문을 맡았네”처럼 확인 가능한 관찰만 남기세요. 서비스는 별도의 감정 점수나 연구로 검증된 분류 결과를 제공하지 않습니다.
실제로 같은 대화를 두 모드에 넣어봤습니다
2026년 9월 16일, 배포된 사이트에서 Gemini 3.5 Flash-Lite로 아래 가상 대화를 분석했습니다. 실제 이용자 기록은 사용하지 않았습니다. 한국어는 같은 파일로 순한맛과 매운맛을 각각 한 번 실행했습니다.
가: 토요일에 공원에서 산책할래?
나: 좋아. 두 시는 어때?
가: 좋아. 비가 오면 카페로 바꾸자.
나: 알겠어. 내가 근처 카페를 찾아볼게.
가: 고마워. 역 앞에서 만나자.
나: 응, 토요일에 봐.
실제 출력과 원문을 대조한 결과
순한맛은 가를 “다정한 길잡이”, 나를 “든든한 서포터”라고 불렀습니다. 상대가 먼저 산책을 제안하고 다른 사람이 카페를 찾아보겠다고 한 것은 원문에서 확인됩니다. 하지만 “주말 데이트”라는 표현도 덧붙였습니다. 두 사람이 연인인지, 친구인지는 입력에 없습니다.
매운맛은 나를 “가성비 하수인”이라고 부르며 “자기 생각은 눈곱만큼도 없고”라고 썼습니다. 그러나 나는 직접 두 시를 제안했습니다. ‘생각이 없다’는 평가는 근거가 없을 뿐 아니라 시간 제안이라는 반례를 놓친 것입니다. 같은 입력이 두 모드에서 반대 방향의 평가로 바뀐 셈입니다.
이 시험에서 알 수 있는 것과 없는 것
확인된 것은 이 한 대화에 대한 두 번의 출력입니다. 모드가 말투와 해석에 영향을 주고, 양쪽 모두 원문에 없는 관계나 성격을 덧붙일 수 있다는 사례입니다. 정확도, 오류율, 모든 요청의 재현성을 측정한 시험은 아닙니다. 같은 파일을 다시 넣어도 문장이 같다고 보장할 수 없습니다.
결과를 검토하는 간단한 기록법
결과에서 “데이트”와 “생각이 없다”를 골라 옆에 근거 문장을 적어보세요. 전자는 근거 없음, 후자는 “두 시는 어때?”라는 반례가 있습니다. 남길 수 있는 관찰은 “가가 산책을 제안했고 나가 시간과 카페 탐색을 제안했다”입니다. 두 모드의 평가를 평균 내기보다 원문에서 검증되는 행동만 남기는 방법입니다.