Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.084 — 2026-09-26
PAPER 约 1 分钟

LLM能否胜任测评题目的试答员

真人校准的Rasch检验发现:LLM答卷虽整齐,却丢失了真人的低分回答。

一套测评正式发布前,通常先请真人试答,看看题目是否太难、选项是否有人使用。若让LLM代劳,关键不只是“答得像人”,还要保留这些诊断信号。Song与Hong用6,245名成人对14道数字使用技能题的回答建立真人基准,再检验1,300个按人口特征匹配的LLM角色所生成的答卷。

最醒目的结果是:LLM答卷的内部一致性很高,Cronbach's alpha约为0.94,说明回答模式相当整齐;但它们选择最低档的比例只有0.2%至0.3%,真人则为13.7%至21.5%。研究者再用Rasch模型——把受试者能力与题目难度放到同一尺度上的心理测量方法——校准后发现,14题中有12题的回答比模型预期更可预测。作者称,即使按预注册方案调整提示词、选项顺序和角色信息,也没能补回真人群体的低端回答。换句话说,答卷看起来稳定,不等于能替代真人试测。


供稿材料 SOURCES — 1

← 返回 2026-09-26 · 数据板块