什么是序列标注任务?请列举三种典型的序列标注问题。 序列标注任务一、定义序列标注Sequence Labeling是指给定一个输入序列X(x1,x2,...,xn)X (x_1, x_2, ..., x_n)X(x1​,x2​,...,xn​)为序列中每个元素xix_ixi​分配一个标签yiy_iyi​输出一个等长的标签序列Y(y1,y2,...,yn)Y (y_1, y_2, ..., y_n)Y(y1​,y2​,...,yn​)。输入序列: x₁ x₂ x₃ x₄ x₅ x₆ ↓ ↓ ↓ ↓ ↓ ↓ 输出序列: y₁ y₂ y₃ y₄ y₅ y₆与普通分类的区别维度普通分类序列标注输入单个样本有序序列输出单个标签每个位置一个标签输出与输入等长上下文依赖通常独立预测标签间存在依赖关系相邻标签往往受约束典型例子垃圾邮件分类整封邮件→垃圾/正常词性标注每个词→词性标签核心难点序列标注的关键挑战在于标签间存在结构性依赖当前位置的标签不仅取决于当前输入还受相邻位置标签约束例如句号后首词更可能是名词而非动词一个实体边界后不应紧跟同一实体的内部标签因此序列标注不能简单地对每个位置独立分类而需要建模标签序列的全局最优结构。二、三种典型序列标注问题1. 词性标注Part-of-Speech Tagging, POS Tagging任务为句子中每个词标注其语法词性类别。输入: 我 爱 自然 语言 处理 标签: 代词 动词 形容词 名词 动词 输入: The cat sits on the mat 标签: DET NOUN VERB ADP DET NOUN标签集通常采用通用词性标注集如 Penn Treebank45 种标签或中文 Universal POS 标签集。应用价值语法分析、句法树构建的基础信息检索中的查询理解机器翻译中的词对齐辅助作为下游 NLP 任务的预处理特征难点一词多类同一个词在不同上下文词性不同“book a book” → 前者 VERB预订后者 NOUN书“fast car” vs “drive fast” → 前者 ADJ后者 ADV需要利用上下文消歧2. 命名实体识别Named Entity Recognition, NER任务识别文本中具有特定意义的实体并标注其类别和边界。输入: 苹果 公司 在 加州 库比蒂诺 成立 于 1976年 标签: B-ORG I-ORG O B-LOC I-LOC O O B-DATE 实体抽取结果: 苹果公司 → ORG组织机构 加州库比蒂诺 → LOC地点 1976年 → DATE日期常用标签编码方案——BIO/BIOES标签含义B-X实体 X 的起始词BeginI-X实体 X 的内部词InsideO非实体词OutsideE-X实体 X 的结束词EndBIOES 方案S-X单字实体SingleBIOES 方案常见实体类别类别示例PER人名张三、Barack ObamaORG机构清华大学、MicrosoftLOC地名北京、New YorkDATE日期2026年7月、March 15thMISC其他世界杯、iPhone 15应用价值知识图谱构建的基础搜索引擎实体链接舆情监控中的人物/机构追踪法律/医疗文本中的关键信息提取难点嵌套实体北京大学计算机学院既是 ORG北京大学又包含子 ORG计算机学院未登录实体新出现的人名、产品名不在词典中边界歧义华盛顿邮报是 PERPER 还是 ORG3. 中文分词Chinese Word Segmentation, CWS任务中文无天然空格分隔词边界需为每个字标注是否为词的边界从而切分出词语。输入字符序列: 说 的 就 是 你 标签序列: B E B E S 分词结果: 说 / 的 / 就 / 是 / 你常用标签方案方案标签集说明2-tagB, EB词首字, E非词首字词尾或单字词4-tag (BMES)B, M, E, SB词首, M词中, E词尾, S单字词BMES 标注示例: 输入: 自 然 语 言 处 理 标签: B M M E B E 分词: 自 然 语 言 / 处 理应用价值中文 NLP 的基础预处理步骤搜索引擎索引构建语音合成中的韵律切分难点切分歧义同一句话有多种合法切分方式“结婚的和尚未结婚的” → “结婚/的/和/尚未/结婚/的” vs “结婚/的/和尚/未/结婚/的”未登录词新词、网络用语不在词典中粒度问题不同应用场景对词粒度要求不同“北京大学” → 整体一个词 vs “北京/大学” 两个词三、三种任务对比维度词性标注命名实体识别中文分词标注对象词词/字字标签集大小中~45类中~10-20类小2-4类核心难点一词多义消歧实体边界识别 未登录实体切分歧义 未登录词上下文依赖强需上下文消歧强需判断实体边界强需消解歧义标签约束语法规则约束BIO 结构约束BMES 结构约束下游作用句法分析基础信息提取基础中文处理基础四、常用模型方法序列标注方法经历了从规则/统计到深度学习的演进方法类别代表模型核心思想统计模型HMM隐马尔可夫模型建模状态转移 观测发射概率判别模型CRF条件随机场给定输入序列建模标签序列的全局条件概率深度学习BiLSTM-CRFBiLSTM 提取上下文特征 CRF 层建模标签依赖预训练模型BERT-CRFBERT 提供强上下文表示 CRF 解码标签序列CRF 层几乎是所有神经序列标注模型的标准组件因为它能建模标签间的转移约束如 I-ORG 不能跟在 B-PER 后面而逐位置独立分类会忽略这种结构约束。五、总结序列标注的本质是为输入序列的每个位置分配标签同时建模标签间的结构依赖关系。三种最典型的任务——词性标注语法类别标注、命名实体识别实体边界与类别标注、中文分词词边界标注——共同构成了 NLP 基础处理链的核心环节是信息提取、知识图谱、搜索引擎等下游应用的基础设施。它们的核心难点虽各有不同消歧、边界识别、切分歧义但都需要利用上下文信息和标签间约束来求解全局最优的标签序列。