文章核心总结与创新点主要内容该研究针对LLM驱动的软件工程(LLM-for-SE)研究,开展了首个大规模实证分析,系统调研2020-2025年间640篇顶会论文,构建了包含7类可复现性缺陷的分类体系(代码与执行、数据、文档、环境与工具、版本控制、模型、访问与法律),探究了缺陷分布、时间演化、artifact徽章可靠性及期刊政策影响。研究发现,访问与法律缺陷(35.9%)、代码与执行缺陷(35.5%)最为普遍,仅13.3%的论文无任何可复现性问题;近年部分缺陷有所改善,但版本控制和访问限制问题加剧;artifact徽章虽能指示 artifact 存在,但无法保证长期可复现性;不同期刊和会议的可复现性政策差异显著。基于研究结果,提出了针对性改进建议和多维度的可复现性成熟度模型(RMM)。创新点首次构建LLM-for-SE领域专属的可复现性缺陷分类体系,涵盖7个核心维度,精准捕捉LLM特有的模型配置、API依赖等复现障碍。完成首个跨2020-2025年、覆盖SE/ML/NLP顶会的大规模实证研究,量化了缺陷分布与时间演化规律。揭示了artifact徽章的局限性,提出超越二元认证的可复现性成熟度模型(RMM),从5个维度划分4个成熟度等级,实现多维度渐进式评估。系统分析了不同类型出版 venue 的可复现性政策差异,为学术共同体制定标准化规范提供实证依据。译文(Markdown格式)