你让同事把报表再检查一遍,期待的是重新按计算器;但如果他只是重读自己的答案,第一次的错很可能被原样保留。Nate Rosidi 用三组小数据测试 ChatGPT,问题包括平均配送时间、最佳销售区域和运动员人数,都是业务团队常见的分析任务。
据作者记录,模型先用 GPT-5.6 Terra 分析,再被要求复核将进入高管演示文稿的数字。一次复核纠正了错误的行数,却同时给一项方向完全相反的结论打了勾;另一次甚至虚构“修正”,把正确答案改错。测试数据本身暗藏常见陷阱:40 笔订单中有 18 笔尚未发货或送达;销售表有重复及互相冲突的地区年度记录;奥运表按“运动员—项目”逐行记录,352 行实际只有 336 名运动员。
这件事值得记住:自我复核只是让模型再读一次,审慎语气不等于独立计算。真正可靠的复核,应把行数、平均数和排序写成可重新运行的 Pandas、数据库查询或表格公式,再比较实际输出,而不是接受一句“已检查”。