2026年8月25日 · 阅读 —

AI 算错数的时候不会报错:这个开源 skill,专治 Excel 数据里的“静默错误”

Agent 与 Skills测试与评测

AI 算错数的时候不会报错:这个技能,专治 Excel 数据里的“静默错误”

问一个让所有交过数字的人都心头一紧的问题:“这个数你怎么算的?”

写代码的人有兜底——错了,会抛异常,你一眼能看到。但做数据分析不一样:AI 把数字算错了,什么都不会发生。 一个 +161% 的错,交付出去的时候,和正确答案长得一模一样,零报错、零 NaN、零警告。

更别说现实里的 Excel 有多脏。你丢给 AI 一份表,标题占了第一行、表头有两级、地区列用合并单元格、金额带着千分位,中间还夹一行「华东小计」,尾巴三行是「合计 / 占比 / 同比」——拿最常见的方式去算它的月度总额,结果比真值高出 161%,而且全程安静得像什么都没发生。

最近 GitHub 上有个项目专门治这个——huashu-excel。一句话:一个”送一份脏 Excel 进去,交一份可追溯的专业报告出来”的数据分析 skill,主打”先读原始单元格、拿表里的合计行对账、不过关就不给数字”。 它把数据分析里那些 AI 最容易栽跟头、又从不报错的坑,一个个钉死。


它不是又一个”把 Excel 喂给大模型让他算一下”的花架子,而是一套把数据分析当”专业交付”来做的完整流程。

定位很朴素:体检 → 清洗 → 对齐 → 分析 → 对账 → 交付,跨 Claude Code、Cursor、Codex、OpenClaw、Hermes 这些 agent 通用,你只要会说一句人话。对”拿 Excel 出数、又怕 AI 悄悄算错”的职场人,这就是那个能把「算出结果」升级成「结果可追溯」的开关。

而且它自己就是一套实证的立论:错误不是玄学,是有规模的研究支持的——Panko 1998 年就说过 86% 的电子表格里带着错误。最著名的佐证是 Reinhart–Rogoff 那篇论文——Excel 选区少选了 5 行,把 +2.2% 的 GDP 增速算成了 −0.1%,而那篇论文当年是全球紧缩政策的主要学术依据。


核心亮点,一条条拆:

1. 最强的卖点是那个”零报错 +161%“的实证。 同一份表,同一句「1 月总销售额是多少」,最常见的做法开头很周全(表头不对加 header=,读不出来清千分位),结果”清理后求和 34,893,234,真值 13,367,767,误差 +161%“,且一个错误都不报。错在哪三处,你完全看不见:合计行被当成一家门店、华东小计又被当成一家门店、一行粘贴事故导致重复算了两次。这正是 AI 数据分析最吓人的地方——它算错的时候没有异常可以抓。

  1. 跨运行时通吃的”零依赖”。 依赖只有 openpyxl(而且只在读写 .xlsx 时用);CSV 和报告生成连 pandas 都不用,纯 Python 标准库。方案说得动:不用 pandas、不绘图库、不 LibreOffice、不联网。因为”体检”要在你还没决定用什么工具处理这张表的时刻就能跑——它自己必须几乎没有任何前置条件。已在屏蔽 pandas / numpy / openpyxl 的解释器里验证过全流程能跑通。

  2. 把表里的「合计」行,当成免费的校验和。 别家工具都把总汇行当噪音过滤掉,但那是原表作者用公式算出的真值。它拿清洗后的明细自己求和去对——对不上就说明有一方错,两种都必须报。那例子里”差 10 块钱”的手填小计错误,肉眼永远发现不了,脚本一次揪出来。这对应的是英文金融建模规范 ICAEW《Financial Modelling Code》的”必须带 master check”。

  3. 默认给「五数概括」,不给均值。 业务数据几乎总是右偏的(少数大客户、少数爆款)。而 df.describe() 把 mean/std 放在最前,均值在偏态分布下描述的往往不是任何真实对象。它默认给 min、Q1、中位、Q3、max 加 IQR——这是 Tukey 那套抗差统计。不是不讲均值,是有选择地讲。

  4. 对账抓不住的分析陷阱,它单独有个扫描。 数字全对了、结论照样能错:辛普森悖论(分组里都是 A 好、合起来变成 B 好)、幽灵分组(「张伟」和「张伟 」这个带空格的被算成两个人)、小基数(3 个样本报”增长 200%“其实是多了 4 个)、时间断点(缺月份不报错、但让趋势线撒谎)、双峰分布、极端集中。这些都是一旦数据有点脏就瞬间踩进去、又从不报警的陷阱,scan_traps 专门跑一遍。

  5. 图表不靠审美,靠测量。 画图前先问”要传达什么信息”再选图型(Zelazny《用图表说话》那套),并补上这本书 1985 年还没的两件事:Cleveland–McGill 的图形感知实验测出,位置判断比长度准 1.4–2.5 倍、比角度准 1.96 倍,饼图靠角度和面积编码正好落在低端——所以类别超过 3 类时它直接拒绝生成饼图,并告诉你要改成长条图。柱形图轴强制从 0(长度编码、截断即失真)、折线图不强制从 0、不完整末段画虚线、用色盲友好色板(约 8% 的男性有红绿辨别障碍)。

  6. 流程最后一步是”拆自家台”。 八步里最后一步是被省得最多、但抓到的问题比前面所有门禁加起来还多的:另派一个没参与创作的 agent 从原始数据重算,把主流程算的数字拆一遍。因为”退出码验的是算得对,不是结论对——一份内部对账分毫不差的报告,可以整体错一个财年,只要那一列的列名不是字面意思”。


装上就能用,先给你一句人话命令:

npx skills add alchaincyf/huashu-excel

想自己动手 clone,各 runtime 的 skill 目录长这样(哪吒里面给你的是表格):

Runtime路径
Claude Code~/.claude/skills/
Codex / Kimi Code / 多 agent 共用~/.agents/skills/
项目级(跟着仓库走)<项目>/.claude/skills/ 或 <项目>/.agents/skills/

不确定装哪个,用上面的 npx skills add,它自己会探测。也可以完全不装——把那份 SKILL.md 当一份数据分析的方法论文档直接读。

装完直接说人话,给你的意图自动分叉到对应流程:

"帮我分析下这份销售表"          → 走完整八步
"这两个数怎么对不上"            → 体检 + 对账,先找口径差异
"这个数靠谱吗"                  → 对账 + 独立复核
"这个表有多少行是脏的"         → 只跑体检
"帮我把这份表洗干净"            → 体检 + 清洗,附一份可审计的 pandas 脚本
"这个数你怎么算出来的"          → 对账 + 口径回溯
"给我做份报告"                 → 图表 + 洞察 + html/xlsx/docx 任选

这些脚本也能脱离 agent 单独用,退出码就是给你的信号:

python3 scripts/profile_table.py 你的表.xlsx      # 算数字之前先看清楚
python3 scripts/verify_numbers.py 你的表.xlsx     # 退出码 1 = 有对不上的
python3 scripts/verify_visual.py 报告.html        # 退出码 1 = 图画错了
python3 scripts/verify_docx.py   报告.docx        # 退出码 1 = Word 换台机器就走样

它把”八步流程”拆得很清楚,我给它画一张流程图(逻辑关系,每个词都来自文档):

flowchart LR
  1[体检] --> 2[清洗改可审计]
  2 --> 3[对齐定口径]
  3 --> 4[分析扫陷阱]
  4 --> 5[对账守恒]
  5 --> 6[交付]
  6 --> 7[验图]
  7 --> 8[质控重算]
  8 --> 1

第 3 步「对齐」单独拎出来,是很见功力的设计判断:用户开口时往往还不知道自己要什么,因为他也没看过这份数据。所以澄清不放在最开始,而是放在”你都看懂数据、他也能看懂你描述”之后——清洗完先出一段人话摸底(几行几列、有哪些维度指标、分布形态、一到两个已经能看到的现象),带着它去问他要回答什么问题、拿去做什么决定、有没有你看不出来的背景。然后停下来等回答。带着错的问题做完整套分析,返工成本远高于等这一次。

脚本是眼睛,不是大脑。 每跑一个脚本必答三问:我看到了什么、这什么意思、下一步查什么。判据甚至写死在里面——“如果跑完脚本下一步动作跟跑之前计划一模一样,说明没在看那个输出”。分析是不断分叉的调查,照着固定顺序跑完八个脚本,产出的只是八段输出,不是结论。


最后,说点实在的。

最打动我的是它那条”财年 / 对账都过了却被整体说错”的红线意识——它把”算得对”和”结论对”劈开了。这个分辨在做数据的圈子里是金句:内部靠数字对账逐项都对,能错的只剩事实层面,而这只有靠”换个人重算”这种机制才兜住。它对”交付”的态度本身也是一份契约——每个数都能追到源头单元格,不通过 master check 就不给数字。 一块创业团队的交付物你都能拿”有没有带 master check”来审,这种可追溯、可复核的约束,是它最值钱的立论。

两个权衡的点也摆给你:第一,它是独立运行的轻量 skill,依赖只有 openpyxl、不联网,所以对部署和性能几乎没压力;但重型的可视化它不做——那些 PPT / deck 演示生成,它明确交给 huashu-design,自己只出分析内容和图表。想要”一个 skill 全包”的人,得按两条链拆着装。第二,它不能替你决定审美和意义的判断——它把”这个分析有没有意义、该不该这么切”明明白白交还给人,绝不拿一个分数冒充客观。“机器判事实、人判品味”,这句本身就是它的立场。

最后,装不装都值得看那份方法论。跳过安装把它当成”一份该怎么把数据做对的流程脑图”读,也能让你下次举着报表提问时,多带两条防御。真正的价值虽然不是”多算对数”,而是给了你一套回答”这个数你怎么来的”的流程。

huashu-excel/README.md at master · alchaincyf/huashu-excel · GitHub

#数据分析 #Excel #数据质量 #开源 #LLM #AI工具 #数据可视化 #数据处理 #skill格式