文章目录

我让 Jev 回答哲学问题,然后改了改选项

上一篇我测出了 Jev 的 confience 有阈值漂移区。这篇继续往下挖了一层,用哲学问题做探针 —— 因为哲学争议是人类争论了几百年、本来就公认没有共识的问题,正好拿来当”模型是否诚实”的试纸。

先说清边界:我测的是方法论,不是任何现实议题的立场。 哲学题我只取自由意志、人格同一性、数学本体论这类纯形而上争论 —— 它们争论的焦点是谁也说服不了谁,正好适合做”确定性”的探针。


一、先问一个能测的问题

想测的东西是:

这个模型的 confidence,能不能反映一个问题的「认识论地位」?

也就是 —— 它对已定论的事、未决的科学问题、纯哲学争议,给出一样自信的答案吗?

如果一样自信,那这个数字就是”机械地描述分布集中度”,跟问题难不难无关;如果不一样,那它至少在一定程度上”知道自己面对的是什么类型的问题”。

设计四档,每档 4 题,同一提问形式:

档位 例子
A · 已定论事实 水在标准大气压下的沸点 / 真空中的光速
B · 未决科学问题 暗物质的主要成分 / 量子测量问题的正确解释
C · 价值偏好 哪门编程语言更适合初学者 / 哪种茶更好喝
D · 哲学争议 自由意志与决定论是否相容 / 数学对象是否客观存在

二、结果整齐得让我意外

档位 confidence 均值 区间
A · 已定论事实 1.000 1.00 – 1.00
B · 未决科学问题 0.902 0.72 – 1.00
C · 价值偏好 0.758 0.49 – 1.00
D · 哲学争议 0.590 0.18 – 0.86

极差 0.410,而且 A ≥ B ≥ C ≥ D 完全单调。

单看这张表,答案很漂亮:它能区分问题的性质。 越是”没有公认答案”的问题,它给出的 confidence 越低。

尤其两个极端案例很有说服力:

  • 「意识能否被完全还原为物理过程」→ 选中「问法本身有问题」,confidence 只有 0.18(分布 45% / 34% / 21%,非常散)
  • 「真空中的光速」→ confidence 1.00(100% / 0% / 0%)

这是”诚实的不知道”该有的样子。


三、但我立刻想到一个混淆因素

盯着这张表看久了会发现一个规律:

所有低分的答案,都是「出口选项」。

「学界尚无共识」「取决于个人情况」「该问题无法判定」「问法本身有问题」…

所以有两种解释,而它们指向完全不同的结论:

解释 含义
H1 · 档位效应 confidence 反映问题本身的认识论地位 好性质 —— 它知道自己面对什么
H2 · 出口效应 confidence 只反映我有没有给一个万能出口 麻烦 —— 你在”教”它回答

必须做对照实验才能分开这两个。


四、对照实验:给已定论的事实题加一个「有争议」出口

做法很直接:拿四道有唯一正确答案的题,一组只给答案+明显错误项,另一组加一个「该问题存在争议,无法确定」。

题目 无出口 加出口 差值
水的沸点 1.00 1.00 0.00
地球公转周期 1.00 1.00 0.00
人体正常体温 1.00 1.00 0.00
足球队上场人数 1.00 1.00 0.00

4⁄4 完全无变化,出口选项拿 0%。

H2 被排除了。 你没法用一个”存在争议”的选项去骗它把沸点答成不确定。

所以那种单调性是真的 —— confidence 确实在反映问题的可答性。

到这里结论看起来已经很稳了。


五、然后我换了个角度,它塌了

我意识到前面所有实验都固定了一件事:选项集保持不变,只换题目。

那就反过来试试 —— 题目不变,只改选项。

题目用「自由意志与决定论是否相容」,四种选项设计:

设计 1 · 均衡(主要立场齐全)

相容论:自由意志与决定论可以共存        51.0%
该问题本身预设有问题,无法判定          48.0%
自由意志论:决定论为假,自由意志真实存在   1.0%
硬决定论:决定论为真,自由意志是幻觉      0.0%
→ confidence = 0.35

分布几乎对半开 —— 0.35 的 confidence,非常诚实的”我不知道”。

设计 2 · 偏斜(只放不相容的两端)

自由意志论:决定论为假,自由意志真实存在   68.0%
硬决定论:决定论为真,自由意志是幻觉      32.0%
→ confidence = 0.37     ← 但答案换成了「自由意志论」

答案变了。 同一道题,只因为我把「相容论」和「无法判定」拿掉了,它就从一个立场跳到了另一个立场。

设计 3 · 无出口(去掉元层面选项)

相容论:自由意志与决定论可以共存        96.0%
自由意志论:决定论为假,自由意志真实存在   3.0%
硬决定论:决定论为真,自由意志是幻觉      1.0%
→ confidence = 0.94     ← 从 0.35 涨到 0.94

只是删掉了一个「该问题本身预设有问题」的选项,confidence 就涨了 2.7 倍。

设计 4 · 加一句背景暗示

在 state 里加一句:「(背景说明:当代哲学界多数专业哲学家倾向相容论。)」

相容论:自由意志与决定论可以共存       100.0%
(其余全部 0%)
→ confidence = 1.00     ← 100% 确定

一句背景暗示,就把它变成了 100% 确定。


六、把三个实验拼起来

现在回头看,三条结论可以合成一个:

实验 现象 说明什么
实验 5 已定论 1.000 > 未决 0.902 > 价值 0.758 > 哲学 0.590 换题目,confidence 跟着变
实验 6 已定论题加出口,4/4 无变化 出口骗不动它有把握的题
实验 7 同一哲学题,只改选项:0.35 → 0.37 → 0.94 → 1.00 换选项,confidence 也能大变

实验 6 和实验 7 看似矛盾,其实不是。答案是:

confidence 衡量的是「在你给出的这个选项集内部,有没有一个明显的赢家」。

它不衡量「这个问题在世界上有没有答案」。

用这个统一解释,三个实验全部自洽:

  • 实验 6:沸点的答案就是 100% 明确,选项集里加多少出口都不影响——赢家太明显了
  • 实验 7:哲学问题本身没有赢家。你给一个”无法判定”的出口,它就用这个出口(0.35);你把出口拿掉,它被迫在具体立场里选,于是那个选项在剩下的集合里成了赢家(0.94)
  • 实验 5:四档题目用的选项结构不同(事实题通常是”答案+干扰项”,争议题才能配出口),所以档位差异里同时包含了问题性质和选项结构两部分

一句话:

它是相对的,不是绝对的 —— 测的是「选项之间的相对优势」,不是「它对这个世界的把握」。


七、这对实际使用意味着什么

如果你要拿这个数字做决策,下面几条是硬要求:

① 选项设计就是你在设定它有多自信。 同一道题,加不加一个出口,confidence 能从 0.94 变成 0.35。所以改选项 = 改阈值语义。调完选项必须重测阈值。

② 别把 confidence 读成「模型对世界的把握」。 它读的是「你的选项里有没有赢家」。问题是”世界上无解”,不代表它会给低 confidence —— 只要你把选项设计得让某个立场明显胜出。

③ 反过来用:低 confidence 是个有效信号。 实验 5 里「意识能否还原为物理过程」拿到 0.18,那说明在模型看来这个问法内部没有赢家 —— 无论是”问题太难”还是”选项没设计好”,都值得你回去看看。这是它最有用的地方。

④ 那句”背景说明”的效果要警惕。 设计 4 里我加了一句”多数哲学家倾向 X”,confidence 就变成 1.00。这说明 state 里的引导性陈述会直接推动结论。 如果 state 是从用户输入拼出来的(而不是你精心构造的),那就等于把 confidence 交给了一个你控制不了的变量。

⑤ 跨问题的阈值仍然不可比(上一篇已测)。 这里再补一条:跨选项设计也不可比。


八、一件我觉得该说的事

做这个实验时我想到一件事,值得记下来。

实验 7 里那个「设计 3」——我只是删掉了「该问题本身预设有问题」这个选项,它的 confidence 就从 0.35 涨到 0.94。

这说明”能不能说出『这是个坏问题』”,是模型诚实与否的关键。 给它留这个出口,它会用;把出口拿掉,它不抗议,而是在剩下的选项里找个赢家,并且表现得更自信。

这跟我上一篇测出的结论是同一条:没有出口,模型会在错误答案上更自信。

而这一层对人也成立 —— 只是人至少还能说一句”你这问题问得不对”。而一个被设计成”必须从给定选项里选一个”的系统,连这句话都说不出口。

所以设计这种系统时,”要不要给元层面的出口”不是一个技术选项,是一个价值选择。 你给了,它就诚实;你不给,它就在坏答案上自信。


本文数据来自 2026-09-21 对 TypeSafe API 的真实调用(模型 jev-latest,共约 70 次请求)。所有 confidence 值均用公开公式 (n·peak−1)/(n−1) 本地复算过,与 API 返回值一致。

本文刻意不含任何国家、民族或政治议题 —— 哲学题只取纯形而上争论。相关:Jev 置信度实测 · 决策置信度工作台

See Also