听清一句话,不等于相信角色真的在笑、抽泣或倒吸一口气。Voice Acting Arena 想测的正是这层差别:它由 LAION 与 TTS Arena 推出,让听众比较同一场景、同一剧本的两段匿名 AI 配音,再判断哪段整体表演更好、更遵循表演指示,也更显得真诚。部分任务还会加入笑声、喘息和啜泣等声音反应。
这种“盲选对战”会隐藏模型身份,尽量减少品牌印象干扰;众包评测则借许多普通听众的选择,衡量“像不像在演”这类难靠单一自动指标概括的体验。它把 TTS——也就是把文字合成人声——的比较重点,从清晰、自然进一步推向情绪和表演。目前公开材料只说明平台将持续收集偏好,并用于后续研究,尚未披露参与规模、模型排名或研究结果。