A Layered Taxonomy for Chinese Learner Grammatical Error Annotation

📄 arXiv: 2609.02153v1 📥 PDF

作者: Mengyang Qiu, Jungyeul Park

分类: cs.CL

发布日期: 2026-09-02


💡 一句话要点

提出分层分类法以解决中文学习者语法错误标注问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 语法错误标注 中文学习 计算机语言学 教学分析 错误分类 分层方案 语言模型

📋 核心要点

  1. 现有的中文学习者语法错误标注方法缺乏一致性和语言学意义,难以满足教学需求。
  2. 本文提出的分层方案通过识别不同层次的错误,结合计算机语法纠正与教学分析,提供更细致的标注。
  3. 实验结果表明,该方案在自动提取的MuCGEC编辑上具有良好的覆盖率,并在一致性研究中显示出有效性。

📝 摘要(中文)

中文学习者写作中的语法错误标注需要既一致又具有语言学意义的标签。本文提出了一种分层方案,将计算机中文语法错误纠正(CGEC)与教学错误分析相结合。该方案首先识别字符和标点级别的正字法错误,通过编辑操作和子类型进行标注。其他错误则采用三层核心标签,结合编辑操作、语言领域和词性,并可选地扩展至中文特有的方面、情态、比较、论元结构和补语。通过CGEC资源、学习者错误分类和普通话语法进行评估,结果支持了分层方法,同时识别出需要进一步细化的类别边界。

🔬 方法详解

问题定义:本文旨在解决中文学习者写作中的语法错误标注问题,现有方法在一致性和语言学意义上存在不足,无法有效支持教学需求。

核心思路:提出的分层方案通过将错误标注分为字符、标点和语法层次,结合编辑操作和语言学特征,旨在提供更为细致和一致的标注体系。

技术框架:整体架构包括三个主要模块:首先识别正字法错误,其次应用三层核心标签,最后结合中文特有的扩展进行标注。

关键创新:最重要的创新在于提出了分层的错误标注体系,能够有效结合计算机语法纠正资源与教学分析,区别于传统的单一标注方法。

关键设计:在设计中,采用了多层次的标签结构,结合编辑操作、语言领域和词性,并允许扩展至特定的中文语法特征,以增强标注的灵活性和准确性。

🖼️ 关键图片

img_0
img_1
img_2

📊 实验亮点

实验结果显示,采用分层标注方案的模型在MuCGEC编辑的覆盖率分析中表现优异,且在一致性研究中,五个大型语言模型的应用结果支持了该方法的有效性,标注一致性显著提高。

🎯 应用场景

该研究的潜在应用领域包括语言学习软件、在线写作辅助工具和教育评估系统。通过提供更为精准的语法错误标注,能够有效提升学习者的写作能力,促进中文学习的效果。未来,该方法还可能扩展至其他语言的学习者错误分析中。

📄 摘要(原文)

Grammatical error annotation in Chinese learner writing requires labels that are both consistent and linguistically meaningful. This paper proposes a layered scheme linking computational Chinese grammatical error correction (CGEC) with pedagogical error analysis. The scheme first identifies character- and punctuation-level orthographic errors, labeling them by edit operation and subtype. Other errors receive a three-layer core label combining edit operation, linguistic domain, and part of speech, with optional Chinese-specific extensions for aspect, modality, comparison, argument structure, and complements. Drawing on CGEC resources, learner-error taxonomies, and Mandarin grammar, the taxonomy is evaluated through a coverage analysis of automatically extracted MuCGEC edits and a preliminary consistency study in which five large language models apply it to a sample. The results support the layered approach while identifying category boundaries requiring further refinement.