AI聊天点评如何生成,又该如何核对?

温和与犀利模式给出不同说法,是因为请求的角度和语气不同,并不表示哪一种更准确。

从文件到分析请求

工具移除日期时间标记,合并同一人的连续发言,最多将最后3,000行经服务器发送给Gemini。时间间隔信息被移除,因此请求本身不能支持等待几小时的计算。

生成文字不等于验证事实

虚构对话“甲:去哪见?/乙:你决定吧”可以看出谁在选择地点,但原文没有说“乙不在乎这段关系”。自然流畅的AI句子仍可能添加没有依据的解释。

比较模式时看什么

温和模式可能把同一行为称为接纳,犀利模式则称为被动。找出共同提到的行为并对照原文。仅语气不同是角度差异;新增事件或百分比则需要证据。

只保留有依据的点评

为每条点评找一句原文。没有依据的内容不要分享。“这次是我负责安排”比评价对方整个人更有依据。本站不提供独立情感分数或经研究验证的分类结果。

用虚构对话做一次实际测试

2026年9月16日,我们在已部署的网站上使用Gemini 3.5 Flash-Lite进行了功能检查,没有使用真实用户记录。中文测试将以下内容提交给毒舌模式一次:

小明: 周六要去公园散步吗?

小林: 好呀,下午两点怎么样?

小明: 可以,如果下雨就去咖啡店吧。

小林: 我来找附近的店。

小明: 谢谢,我们在车站见。

小林: 周六见。

实际输出与原文的差别

结果称小明“社交低能的温吞水”,称小林“廉价的免费劳动力”,还把小林描述为“毫无底线的讨好型人格”。但原文只能确认小林提议了两点见面,并愿意找店。一次分工不能证明固定人格,更不能证明没有底线。结果说小明把选择权全权交给别人,也忽略了小明提出公园和雨天备选地点。

另一次韩语对照使用同一份韩语文件分别运行温和与毒舌模式各一次,得到方向不同的评价。这是韩语对照,不代表本次已比较中文的两种模式。

这次测试的适用范围

它说明一次正常返回的分析也可能增加原文没有的人格与关系判断。我们没有测量错误率、整体准确度或重复运行的一致性。同样输入再次提交时,措辞也可能改变。

自己核对结果的方法

选择一句评价,在旁边写下支持它的原文。“没有主见”旁边能写下什么?本例反而有“两点怎么样”和“雨天去咖啡店”的提议。可保留的观察是:小明提议散步,小林提议时间并主动找店。核对行为比接受强烈标签更可靠。

返回列表