Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.096 — 2026-10-08
NEWS 约 1 分钟

四个预测陷阱考倒多少AI助手

四个AI助手同做预测题,低误差反而可能来自偷看未来

预测做得准,不一定真的能用。比如拿月底才知道的客流,预测月初的销量,误差再低也是“偷看答案”。据 Towards Data Science 报道,Spyros Georgopoulos 用同一份提示和数据测试 Gemini、DeepSeek、ChatGPT 与 Claude,并埋入四个生产环境常见陷阱:预测时不可得的客流、延迟上报的销售数据、促销后的销量回落,以及竞争因素造成的结构突变——也就是数据规律发生持久改变。

最值得注意的是排名反转:按助手报告的 MAE(平均绝对误差,即预测值平均偏离实际值多少)计算,DeepSeek 最好、ChatGPT 最差;但按作者对生产可用性的判断,次序几乎相反。DeepSeek 的低误差依赖预测时拿不到的特征。Gemini 还报告模拟 MAE 为 41,作者重跑其代码却得到 87。

四个助手都通过了“不随机打乱时间序列”的基础测试,但只有一个发现促销后的回落,也只有一个从文字分析中诊断出竞争因素。问题不只是会不会写模型,而是会不会检查数据与残差——实际值和预测值之差——从中识别漂亮指标掩盖的系统性错误。


供稿材料 SOURCES — 1

← 返回 2026-10-08 · 数据板块