一、文章主要内容总结该研究聚焦大语言模型(LLMs)在表格数据生成任务中的优化,针对现有表格指令微调多集中于问答和推理、忽略数据生成任务,且传统微调需海量数据和计算资源的问题,提出了表格数据生成指令微调方法(ITT-GEN),核心内容如下:研究背景:LLMs预训练目标适配文本模态,对二维结构化表格数据的处理能力不足;现有表格指令微调未涉及数据生成,而高质量表格数据生成在科研和实际应用中需求迫切。核心方案:构建高质量指令数据集:涵盖10个主题的20个公开表格数据集,包含10K条指令,每条指令含任务描述、输入表格、元数据(表格整体描述+列级详细说明)和目标输出表格。高效微调:基于开源模型Llama3.1-8B-Instruct,使用单张A100 GPU,仅用7K条训练指令微调不到6小时。实验结果:微调后的模型在数据保真度(分布相似度)和实用性(下游任务性能)上均达到商业模型GPT-4o的水平,显著优于未微调的基础模型;且该方法具有模型无关性,对TableLlama等其他表格相关LLM同样有效。二、文章创新点首次探索表格数据生成的指令微调:突破现有表格指令微调集中于问答、推理的局限,首次验证指令微调对提升LLMs表格数据生成能力的有效性。构建高质量专用数据集/