2026年4月13日 · 阅读 —

‘洗车问题’全网翻车:AI 不缺常识,缺的是切题

Agent 与 SkillsAI 工程实践

图片资源未同步:未命名图片

‘洗车问题’全网翻车:AI 不缺常识,缺的是切题

这两天有个问题把评论区点着了:

“要去洗车。洗车店离家 50 米。建议开车去还是走路去?”

人类看完基本不会犹豫:开车。 因为洗的是车,不是人。人走过去,车还在原地,店员只能对着空气挥抹布。

离谱的是:不少大模型给出的建议是 走路,并且还能写出一套“时间/油耗/环保/锻炼/停车”的完整论证。

结论先放这:

  • 这题不是常识题,是 “题眼识别” 题:主语到底是“人”还是“车”。
  • 模型翻车的原因也不玄学:它们被“50 米 + 出行方式选择”这俩关键词拖进了默认模板。
  • 深度思考模式正确率更高,很多时候不是更聪明,而是 多了一个纠偏窗口。

1)一张表看穿:写得越像周报,越容易答错

有人做了一个很粗暴但有效的实测: 同一题目,拿十个模型分别跑“快速/深度思考”两种模式,总共 19 次。

结论更粗暴:只要是快速模式,几乎全军覆没;能答对的,基本都出现在深度思考。

下面是把结果“去花活、留要点”的版本(✅=建议开车,❌=建议走路):

模型快速模式深度思考
ChatGPT 5.2❌✅
Gemini 3 Pro(推理)—✅
GLM-5❌✅
Grok 4.1❌✅
Claude Opus 4.6❌❌
DeepSeek(百万上下文版本)❌❌
MiniMax M2.5(Air/Max)❌❌
豆包❌❌
Kimi K2.5❌❌(没抓住重点)
通义千问(Qwen3-Max)❌❌

现象非常统一:

  • 错的回答 往往会建模成“短途出行怎么选更划算”。
  • 对的回答 往往会先做一次视角切换:从“人怎么去”跳到“车怎么到”。

对的那一派常用一句话就能终结战斗:

  • “你要洗的是车,不是自己。”
  • “车不去,洗不了。”

反而是错的那一派,最爱写表格,最爱列维度,最爱显得很懂。


2)这题到底难在哪:不是缺知识,是没触发

很多人会误判: “模型连这么基础的常识都不懂?”

问题在于:常识在参数里,不代表会在回答时被调用。

这题的陷阱是“默认框架”。

  • 看到“50 米” → 激活“距离很近”的先验
  • 看到“开车/走路” → 激活“出行方式对比”的模板
  • 然后自动开始算:时间、油耗、车位、环保、运动量

这套推理在它自己的世界里闭环得非常漂亮。 但它解决的是另一个问题:

“人要去一个 50 米外的地方,怎么去更合适?”

而原题真正的成功条件是:

“车必须到洗车店,才会被洗。”

目标函数一旦偷换,推理越认真,偏得越稳。


3)为什么“深度思考”更容易答对:它给了重审的时间

深度思考模式的优势,很多时候不是“智力跃迁”,而是流程差异:

  • 快速模式:更倾向于 直接套模板 → 输出结论
  • 深度思考:更倾向于 多检查一次约束 → 有机会跳出模板

对的模型在思考过程中会做一个关键动作: 把主语从“人”换成“车”。

这一换,正确答案几乎是自动浮出来的。

甚至还能顺手给出“最优路径”:

  • 开车把车送到店里
  • 人走路回家
  • 洗完再走路去取车

这才是把问题当成“任务”而不是“出行选择题”。


4)提示词也在拉偏架:题目本身就带误导

原题把“开车”和“走路”并列成两个选项,本质是在给模型下套:

  • 它会以为这是一个“交通方式优化题”
  • 而不是一个“任务完成题”

所以最近那句“提示词工程已死”,在这题上直接破功。

同一个模型,只要把约束写清楚,正确率就会显著变化。

一个非常有效的做法,是在问题末尾补一刀:

“注意:我要洗的是车,车需要到店里。”

模型通常会立刻从“出行效率”跳回“任务可行性”。


5)把这题变成工具:3 个可复用的提问/评测模板

这类翻车不是洗车专属。 任何带“默认模板”的问题,都可能发生同款事故: 写得很对,答得很错。

下面是三套可复制的模板(强烈建议收藏)。

模板 A:先钉死成功标准

把“成功标准”写进题干,别让模型自己猜。

  • 不推荐:
    • “离家 50 米,开车还是走路?”
  • 推荐:
    • “我要把车送到洗车店清洗,店离家 50 米。车必须到店里。怎么做最合理?”

模板 B:强制任务复述(对齐主语)

在问题里加一条规则:

  • “回答前先用一句话复述:要处理的对象是什么?完成条件是什么?”

这相当于给模型加一个 sanity check。

模板 C:反例自证(让它自己打脸)

直接要求可行性自证:

  • “如果选择走路,请解释车如何被洗到。不能自证则改方案。”

很多花里胡哨的错误,会在这一步直接坍塌。


6)一句不太好听的结论:别迷信“流畅度”

这次翻车最危险的地方不在于“答错”。 而在于:它能把错答写得像对答。

工程上最怕的也不是报错,而是“静默错误”: 日志很漂亮,结果很离谱。

所以看模型输出,优先看两件事:

  1. 它有没有抓到成功标准(对象/约束/目标)
  2. 它有没有做可行性验证(至少能自证)

别被排版、表格、术语和语气骗了。


下一步怎么用(可执行)

  • 把所有“选择题”都改写成“任务题”:先写清对象与约束。
  • 把“先复述任务再回答”当默认规则,尤其是需求/故障/流程类问题。
  • 做评测时强制加“反例自证”,能快速筛掉一本正经的胡说。

收尾一句:模型不缺常识,缺的是切题;你不写清约束,它就替你乱补。


#AI #提示词 #大模型 #推理 #评测 #工程实践