2026年4月13日 · 阅读 —
‘洗车问题’全网翻车:AI 不缺常识,缺的是切题
图片资源未同步:未命名图片
‘洗车问题’全网翻车:AI 不缺常识,缺的是切题
这两天有个问题把评论区点着了:
“要去洗车。洗车店离家 50 米。建议开车去还是走路去?”
人类看完基本不会犹豫:开车。 因为洗的是车,不是人。人走过去,车还在原地,店员只能对着空气挥抹布。
离谱的是:不少大模型给出的建议是 走路,并且还能写出一套“时间/油耗/环保/锻炼/停车”的完整论证。
结论先放这:
- 这题不是常识题,是 “题眼识别” 题:主语到底是“人”还是“车”。
- 模型翻车的原因也不玄学:它们被“50 米 + 出行方式选择”这俩关键词拖进了默认模板。
- 深度思考模式正确率更高,很多时候不是更聪明,而是 多了一个纠偏窗口。
1)一张表看穿:写得越像周报,越容易答错
有人做了一个很粗暴但有效的实测: 同一题目,拿十个模型分别跑“快速/深度思考”两种模式,总共 19 次。
结论更粗暴:只要是快速模式,几乎全军覆没;能答对的,基本都出现在深度思考。
下面是把结果“去花活、留要点”的版本(✅=建议开车,❌=建议走路):
| 模型 | 快速模式 | 深度思考 |
|---|---|---|
| ChatGPT 5.2 | ❌ | ✅ |
| Gemini 3 Pro(推理) | — | ✅ |
| GLM-5 | ❌ | ✅ |
| Grok 4.1 | ❌ | ✅ |
| Claude Opus 4.6 | ❌ | ❌ |
| DeepSeek(百万上下文版本) | ❌ | ❌ |
| MiniMax M2.5(Air/Max) | ❌ | ❌ |
| 豆包 | ❌ | ❌ |
| Kimi K2.5 | ❌ | ❌(没抓住重点) |
| 通义千问(Qwen3-Max) | ❌ | ❌ |
现象非常统一:
- 错的回答 往往会建模成“短途出行怎么选更划算”。
- 对的回答 往往会先做一次视角切换:从“人怎么去”跳到“车怎么到”。
对的那一派常用一句话就能终结战斗:
- “你要洗的是车,不是自己。”
- “车不去,洗不了。”
反而是错的那一派,最爱写表格,最爱列维度,最爱显得很懂。
2)这题到底难在哪:不是缺知识,是没触发
很多人会误判: “模型连这么基础的常识都不懂?”
问题在于:常识在参数里,不代表会在回答时被调用。
这题的陷阱是“默认框架”。
- 看到“50 米” → 激活“距离很近”的先验
- 看到“开车/走路” → 激活“出行方式对比”的模板
- 然后自动开始算:时间、油耗、车位、环保、运动量
这套推理在它自己的世界里闭环得非常漂亮。 但它解决的是另一个问题:
“人要去一个 50 米外的地方,怎么去更合适?”
而原题真正的成功条件是:
“车必须到洗车店,才会被洗。”
目标函数一旦偷换,推理越认真,偏得越稳。
3)为什么“深度思考”更容易答对:它给了重审的时间
深度思考模式的优势,很多时候不是“智力跃迁”,而是流程差异:
- 快速模式:更倾向于 直接套模板 → 输出结论
- 深度思考:更倾向于 多检查一次约束 → 有机会跳出模板
对的模型在思考过程中会做一个关键动作: 把主语从“人”换成“车”。
这一换,正确答案几乎是自动浮出来的。
甚至还能顺手给出“最优路径”:
- 开车把车送到店里
- 人走路回家
- 洗完再走路去取车
这才是把问题当成“任务”而不是“出行选择题”。
4)提示词也在拉偏架:题目本身就带误导
原题把“开车”和“走路”并列成两个选项,本质是在给模型下套:
- 它会以为这是一个“交通方式优化题”
- 而不是一个“任务完成题”
所以最近那句“提示词工程已死”,在这题上直接破功。
同一个模型,只要把约束写清楚,正确率就会显著变化。
一个非常有效的做法,是在问题末尾补一刀:
“注意:我要洗的是车,车需要到店里。”
模型通常会立刻从“出行效率”跳回“任务可行性”。
5)把这题变成工具:3 个可复用的提问/评测模板
这类翻车不是洗车专属。 任何带“默认模板”的问题,都可能发生同款事故: 写得很对,答得很错。
下面是三套可复制的模板(强烈建议收藏)。
模板 A:先钉死成功标准
把“成功标准”写进题干,别让模型自己猜。
- 不推荐:
- “离家 50 米,开车还是走路?”
- 推荐:
- “我要把车送到洗车店清洗,店离家 50 米。车必须到店里。怎么做最合理?”
模板 B:强制任务复述(对齐主语)
在问题里加一条规则:
- “回答前先用一句话复述:要处理的对象是什么?完成条件是什么?”
这相当于给模型加一个 sanity check。
模板 C:反例自证(让它自己打脸)
直接要求可行性自证:
- “如果选择走路,请解释车如何被洗到。不能自证则改方案。”
很多花里胡哨的错误,会在这一步直接坍塌。
6)一句不太好听的结论:别迷信“流畅度”
这次翻车最危险的地方不在于“答错”。 而在于:它能把错答写得像对答。
工程上最怕的也不是报错,而是“静默错误”: 日志很漂亮,结果很离谱。
所以看模型输出,优先看两件事:
- 它有没有抓到成功标准(对象/约束/目标)
- 它有没有做可行性验证(至少能自证)
别被排版、表格、术语和语气骗了。
下一步怎么用(可执行)
- 把所有“选择题”都改写成“任务题”:先写清对象与约束。
- 把“先复述任务再回答”当默认规则,尤其是需求/故障/流程类问题。
- 做评测时强制加“反例自证”,能快速筛掉一本正经的胡说。
收尾一句:模型不缺常识,缺的是切题;你不写清约束,它就替你乱补。
#AI #提示词 #大模型 #推理 #评测 #工程实践