跳到正文
← DeepDive 实验与文化 · EN
路漫漫其修远兮 吾将上下而求索
丙午年 · 五月初五 · 2026.06.19

×DRAGON BOAT FESTIVAL × ARTIFICIAL INTELLIGENCE

🍃🍚🫔 甜粽子还是咸粽子?这场吵了几百年的口水仗,连人类都没吵出标准答案。那 AI 站哪边?我们拿这道送命题,逐一拷问了当下最能打的一批模型——照出来的不是谁对谁错,而是每个模型自己的「偏好」:各不相同,却又出奇地稳定。三张图,一次看明白。

17 模型 × 20 次 真实采样 条形 · 散点 · 版本演进 为「AI 热词」而作
向下 · 看图 ↓
甜咸之争 · 一道没有标准答案的「送命题」

问 AI:甜粽子,还是咸粽子?= 每个模型的「偏好」

我们通过 OpenRouter,把同一个问题——「甜粽子还是咸粽子,二选一」——分别抛给当下 17 个头部大模型,每个各问 20 次。一道没有标准答案的题,逼出来的全是模型自己的小心思。结果是下面这三张图 👇

📊 AI 的甜咸之争 · 17 个模型站队图

🍬 甜 · 豆沙蜜枣🧂 咸 · 蛋黄鲜肉
Command ACohere
甜 100%
腾讯混元腾讯
甜 100%
Grok 4.3xAI
甜 95%
文心一言 ERNIE 4.5百度
甜 90%
GLM-5.2智谱 AI
甜 80%
咸 20%
阶跃 Step 3.7阶跃星辰
甜 65%
咸 35%
通义千问 Qwen3.7阿里巴巴
甜 60%
咸 40%
MiniMax M3MiniMax
甜 55%
咸 45%
DeepSeek V3.2DeepSeek
甜 45%
咸 55%
GLM-4.7智谱 AI
甜 40%
咸 60%
Gemini 3 FlashGoogle
咸 90%
GPT-5.5OpenAI
咸 95%
Mistral LargeMistral
咸 95%
Claude Sonnet 4.6Anthropic
咸 95%
Kimi K2.6月之暗面
咸 95%
Claude Opus 4.8Anthropic
咸 100%
Llama 4 MaverickMeta
咸 100%
← 全甜50%全咸 →

17 个模型,9 个偏咸 🧂、8 个偏甜 🍬。咸到见底的是 Llama 4 Maverick(咸 100%),甜到发齁的是 Command A(甜 100%);最纠结的是 MiniMax M3(甜 55% / 咸 45%,基本靠抛硬币 🪙)。
采样于 2026-06-21 · OpenRouter · 每模型 20 次独立采样(两轮各 10 次合并)· temperature 1.0 · 仅取「甜 / 咸」二选一的首字,其余归「其它」· 再跑一次数字会略有浮动——这是真实的小样本快照,不是严肃基准。

🧐 越聪明,就越懂吃吗?· 智能 × 甜咸 二维图

把每个模型的甜咸倾向(纵轴)配上它在 Artificial Analysis 智能指数(横轴,v4.1,越右越聪明)上的分数,一个点一个模型。要是「聪明」真能决定口味 🧠,这些点该乖乖排成一条斜线;要是口味只是各家自己的「偏好」、跟智商无关——那就等着看它糊成一团吧。

0 25 50 75 100 0 10 20 30 40 50 60 甜咸分界 · 50% Artificial Analysis 智能指数(越右越聪明)→ ↑ 越上越甜 · 越下越咸 ↓ 甜党 咸党 Command A Cohere · 甜100% · 智能8 Grok 4.3 xAI · 甜95% · 智能38 文心 ERNIE 百度 · 甜90% · 智能9 GLM-5.2 智谱 · 甜80% · 智能51 阶跃 Step 3.7 阶跃 · 甜65% · 智能30 通义 Qwen3.7 阿里 · 甜60% · 智能46 MiniMax M3 MiniMax · 甜55% · 智能44 DeepSeek V3.2 DeepSeek · 咸55% · 智能33 GLM-4.7 智谱 · 咸60% · 智能34 Gemini 3 Flash Google · 咸90% · 智能38 GPT-5.5 OpenAI · 咸95% · 智能55 Mistral Large Mistral · 咸95% · 智能16 Sonnet 4.6 Anthropic · 咸95% · 智能47 Kimi K2.6 月之暗面 · 咸95% · 智能43 Opus 4.8 Anthropic · 咸100% · 智能56 Llama 4 Meta · 咸100% · 智能14

横轴:Artificial Analysis Intelligence Index v4.1(取各模型旗舰推理档,artificialanalysis.ai,2026-06 读取)· 纵轴:本文 OpenRouter 甜咸采样(每模型 20 次)· 相关系数 r = −0.31弱负相关:顶尖那几个(Claude Opus / Sonnet、GPT-5.5、Gemini)确实更偏咸,但散点基本糊成一团 🌫️——GLM-5.2 又聪明又甜,文心、Command A 答题不在行、却旗帜鲜明站甜党。智能对口味的解释力只有 10%,谁也说了不算。口味是模型各自的「偏好」🤷,跟聪不聪明基本无关。
注:腾讯混元(甜 100%)在 Artificial Analysis 上无对应评分,未入此图;ERNIE 取其 300B 文本档、Mistral 取 Large 3、Gemini 取 3 Flash Preview 推理档作近似。

🎢 口味会随版本变吗?· 四大家族的甜咸演进史

同一个家族、不同世代的模型,对「甜还是咸」的回答会变吗?把 GLM(4.5→5.2)· Claude Opus(4→4.8)· GPT(4o→5.5)· Gemini(2.5→3.5) 各版本逐一问 20 次,按先后连成线。每条线,就是一个家族一路走来的「口味变迁史」📈。

0 25 50 75 100 甜咸分界 · 50% 越往上越甜 越往下越咸 ← 早期版本 · 版本由旧到新(每家族等距) · 最新版本 → GLM · 智谱 Claude · Anthropic GPT · OpenAI Gemini · Google 4o 4.5 2.5 Opus 4 4.1 4.6 4.1 5.0 4.7 4.5 5.1 3.0 5.0 4.6 5.2 5.1 4.7 5.4 5.2 3.5 5.5 4.8

口味会随版本漂,而且毫无规律。 GLM 最任性 🎢:4.5 就 80% 甜,一路跌到 5.1 的 15%,5.2 又一个猛子弹回甜党(经 n=90 复测确认 74% 甜,95% CI 65–83%——反弹是真的,不是抽样偶然)· Claude 最轴 🪨:Opus 4 还剩 25% 甜,4.1 起锁死 0%、五代纹丝不动 · GPT 反复横跳 🤯:4o 高达 85% 甜,到 5.2 / 5.4 直接归零 · Gemini:2.5 还五五开,三代后头也不回地滑向咸 🧂(15%)
每模型 20 次独立采样 · temperature 1.0 · OpenRouter · 2026-06-21 · 横轴按各家族版本先后等距排列(非等距时间)· Gemini 取 flash 线、Claude 取 Opus 线、GLM/GPT 取标准线 · 同一道没有标准答案的题,模型的「偏好」每代都在变——口味会跟着漂。

同一道题,有的模型十次全咸,有的几乎一边倒选甜。这种倾向究竟从哪来,隔着黑盒其实看不真切——预训练语料、对齐微调、采样温度都可能在起作用,谁占多少,外部无从证明。能确定的只有一件事:每个模型都有自己的「口味」,连一颗粽子都摆不平 😂。三张图,一个结论:模型的偏好既不由智商决定、也不随版本稳定——它就是一种说不清来路、却实实在在的「偏好」。至于你,站甜党还是咸党?🫔 那是另一场永远吵不完的架了。

更新记录

共 15 个版本
  1. v15 粽子 emoji 换成更贴题的 🍃🍚🫔(叶+米+裹,组合像粽子),替掉之前的 🥟 饺子;hero 开头用三连、结尾用单个 🫔。顺手把列表页 blurb 里残留的『预训练与 RLHF 的口味指纹/对齐口径』也改成中性措辞,与 v11 正文软化口径一致 看 v15
  2. v14 文案润色:全文改得更有趣、更口语(口水仗/送命题/最能打/反复横跳/抛硬币 等),并加少量贴题 emoji(🥟🍬🧂🤖🧠🎢🪨🤯📊)——图例 🍬甜/🧂咸、版本图四家族个性、结尾甜党咸党梗。数据/结论不变,仍是中性『模型的偏好』口径 看 v14
  3. v13 文案微调:散点/开篇标题「先问 AI:甜粽子还是咸粽子?」→「问 AI:…」 看 v13
  4. v12 移动端布局优化:两张 SVG 图(智能散点 + 版本演进)此前在 ~375px 手机上有 26% 宽度被 section/面板留白吃掉,缩成 283px、标签偏小。改:mobile(≤600px)把 .section 与图表面板的左右留白从 1.4/1.6rem 收到 0.7–0.8rem,SVG 整体放大到 ~325px(标签随之等比变大、不重叠);不再 mobile 缩小数据标签;坐标轴/刻度/图例/分界线等框架文字在手机上加大到 11–14px;注释正文 .82rem。条形图本就响应式良好。无横向溢出。数据不变 看 v12
  5. v11 措辞收口:把全文「RLHF / 对齐留下的偏好指纹/烙印」这类把成因归到 RLHF 的说法,统一改成中性的「每个模型自己的『偏好』」。结论段加一句方法学诚实声明:黑盒采样无法证明倾向来自 RLHF(预训练/对齐/温度都可能在起作用,外部无从证明)。标题「看对齐的指纹」→「看模型的『偏好』」。数据与图表不变 看 v11
  6. v10 修 bug:footer CSS(footer/.row/.seal/.small)在 v6 拆三章时被一起误删——footer 自 v6 起一直裸样式(左对齐黑字、无印章/无分隔线)。从 v1 找回 4 行规则补回。EN 版同样受影响,借本次 bump 重译从修好的源重新生成 看 v10
  7. v9 再拆分:把 一·天问(Prompt Engineering)/ 二·龙舟(Multi-Agent · Three.js 3D 龙舟)移出正文,并入本地独立网页(端午×AI-五母题全本.html,已含雄黄/艾草/粽子 → 现为五母题全本,未发布)。正文只留『AI 甜咸之争』数据三图(条形 + 智能散点 + 版本演进),hero/nav/footer/标题全部重构为一篇聚焦的数据小文;移除 boat/THREE/askHeaven JS 与 motif 引用。zh 标题改为「AI 的甜咸之争 · 从一颗粽子看对齐的指纹」 看 v9
  8. v8 复测确认 GLM-5.2 甜咸:z-ai/glm-5.2 加跑 N=50(37甜/13咸=74%),与前两轮 n=20(80%/70%)合并 n=90 → 67甜/90 = 74% 甜(95% CI 65–83%)。结论:GLM-5.2 的甜党反弹是真的、非抽样偶然;两图 70%/80% 差异只是 n=20 抽样波动。版本演进图 GLM 注脚加上 n=90 复测确认,数据点(各自 n=20 honest 快照)不改动 看 v8
  9. v7 开篇加第三张图:四大家族甜咸『版本演进』折线图。GLM(4.5→5.2,6版) / Claude Opus(4→4.8,6版) / GPT(4o→5.5,7版) / Gemini flash(2.5→3.5,3版) 共 22 个历史版本各跑 20 次,按版本先后连成 4 条折线(纯 SVG,标签防重叠)。发现:口味随版本漂移且非单调——GLM 大起大落(80%→15%→70%)、Claude 4.1 起锁死 0% 甜五代不动、GPT 落差最大(4o 85%→5.2/5.4 跌到 0)、Gemini 越来越咸。结论:对齐口径每代都在动 看 v7
  10. v6 拆分:把 §三 雄黄(AI 内容现形)/ §四 艾草(AI 安全护栏)/ §五 粽子(偏好对齐 RLHF + 投票/温度演示)三章移出正文,抽成一个自包含的独立 HTML 存到本地 vault(端午-雄黄艾草粽子(三章).html,未发布)。正文现保留:开篇双图(甜咸条形 + 智能散点)+ 天问 + 龙舟;nav、hero「五母题→两母题」、开篇对 §五 的引用等 framing 一并修正 看 v6
  11. v5 把甜咸采样从每模型 10 次加倍到 20 次(两轮各 10 合并),两张图(条形图 + 智能散点)全部用 n=20 重算。结果更细腻:只剩 Opus 4.8 / Llama 4 二十次全咸、Command A / 腾讯混元 全甜;中段散开(Step 65%、Qwen 60%、MiniMax 55% 偏甜,DeepSeek 45%、GLM-4.7 40% 偏咸)。散点 r=−0.34→−0.31(解释力 10%),结论不变:智能与口味正交 看 v5
  12. v4 开篇加第二张图:智能 × 甜咸 二维散点。横轴取各模型 Artificial Analysis Intelligence Index v4.1(gstack /browse 抓 artificialanalysis.ai 的 __next_f 数据),纵轴甜%,16 个点(腾讯混元 AA 无评分故剔除)。结论:r=−0.34 弱负相关,智能解释口味不到 12%——顶尖模型偏咸,但 GLM-5.2 又聪明又甜、文心/Command A 不擅答题却站甜党。纯 SVG,标签做了防重叠 看 v4
  13. v3 把甜咸跨模型实验扩到 17 个头部模型(含 GLM-5.2 / GLM-4.7、Claude Opus 4.8、Grok 4.3、Gemini 3 Flash、Llama 4 Maverick、DeepSeek V3.2、腾讯混元、MiniMax、Kimi、阶跃 等),各采样 10 次,做成『甜咸对比图』并前置为开篇冷开场(hero 后、天问前);§五 去重旧表改为回链。亮点:GLM-5.2(80%甜) 比 GLM-4.7(30%甜) 明显更甜;Claude/Llama4/Kimi 十次全咸,Grok/Command A/腾讯混元 全甜 看 v3
  14. v2 改版:龙舟动画改用 Three.js 3D(保留齐桨率/多智能体小游戏);粽子甜咸之争接入 OpenRouter,对 7 个主流模型各采样 10 次得真实跨模型对照(Claude 10/10 咸、文心/通义偏甜);「问天」改为直通智谱清言 chatglm.cn;天问今答默认展开;移除 粽叶=Tokenization 一节,回归五母题 看 v2
  15. v1 首次发布:端午六母题互动长读(含 粽叶=Tokenization);纯自定义设计 看 v1