文章总结与翻译一、主要内容本文提出了一种名为Blu-WERP的新型数据预处理管道,专门用于优化Common Crawl WARC文件的质量,以适配大型语言模型(LLM)训练。该管道通过文本提取、去重、分类器过滤三大核心模块,解决了现有预处理方案在大规模数据清洗、语义相关性保留与下游模型性能平衡方面的不足。研究团队在150M至1B参数的多种模型上,基于9个标准基准(涵盖世界知识与推理、语言理解、常识推理三大类别)进行了全面评估。结果显示,Blu-WERP在所有模型规模下均表现优异:在1B参数规模时,相较于DCLM和Fineweb分别实现了4.0%和9.5%的综合性能提升,同时提升了每token的质量效率;在分类别评估中,世界知识与推理任务提升2.4%,语言理解任务提升6.2%,常识推理任务提升4.2%。此外,通过基于缩放定律的数据集选择协议,该管道在多十亿参数模型上的性能优势也得到了预测验证。二、创新点语义感知与基准驱动的过滤机制:融合FastText分类器与BETR(基准目标排序)方法,实现动态反馈式过滤,优先保留语义丰富且与基准任务高度对齐的内容,突破了传统静态启发式规则的局限性。分层去重策略:采用优化后的Bloom Filter分层去重方案(支持段落级与文档级联动检测),在降低内存占用的同时,有效去除精确重复与近重复内容,平衡了计算效率与去重准确性。多模块协同优化:通过系统的消融实验,筛选出最优文本提取器(Justex