同一个词换个句子,可能就从一种词性变成另一种;如果连训练数据里的“标准答案”都前后不一,AI 学得再认真,也可能学错。Eric Pardede 团队为此整理了 IDeal:一套经语言学家复核的印尼语词性标注语料。词性标注就是给每个词贴上名词、动词、形容词等语法标签,是搜索、翻译和文本分析的基础环节。
团队以一套含 21,024 个句子的现有语料为起点,通过识别、检测和纠正不一致标签来提高可信度。在 2,457 个已验证的单分句上,标签变化的熵——可粗略理解为标注混乱程度——从 0.04 降至 0.02。作者报告称,使用 IDeal 后,模型在一般情况和词性歧义情况下的 Macro F1——兼顾各类标签表现的综合分数——分别提高约 8% 和 9%。不过,这些结果仅来自受限的单分句场景,摘要也未披露模型面对未登录词时的单独提升幅度。