Scaling Item-to-Standard Alignment with Large Language Models: Accuracy, Limits, and Solutions
文章总结与翻译一、主要内容该研究聚焦于利用大型语言模型(LLMs)解决教育领域中评估项目与内容标准的对齐问题,通过三项实证研究系统验证了LLMs在规模化对齐任务中的性能、局限性及优化方案,核心内容如下:研究背景:传统人工对齐评估项目与内容标准的方式准确但耗时费力,难以适配大规模题库和标准更新需求;早期NLP嵌入方法在处理细微语义差异时效果有限,而LLMs具备深度语境理解和推理能力,为规模化对齐提供了可能。研究设计:基于K-5年级数学和阅读学科的12,000余条项目-技能对,测试了GPT-3.5 Turbo、GPT-4o-mini和GPT-4o三款模型,围绕三类核心任务展开:研究1:二分类任务(判断项目与标准是否对齐),涵盖完全错位、部分错位、轻微错位三种错位类型;研究2:开放集分类任务(从全量年级-学科标准中选择最优匹配技能);研究3:检索增强分类任务(通过句子嵌入预筛选候选技能,再进行LLM分类)。核心发现:GPT-4o-mini在二分类任务中准确率达83%-94%,但对同领域轻微错位的识别能力较弱;数学学科对齐性能优于阅读(阅读标准语义重叠度更高),开放集分类任务中阅读学科Top-1准确率最低仅39.35%;句子嵌入预筛选可显著提升性能,GPT-4o结合筛选后,正确技能进入Top5的概率超95%