文章主要内容与创新点总结一、主要内容本文聚焦提示特异性(prompt specificity,即提示的详细或模糊程度)对大型语言模型(LLMs)推理性能的影响,提出了DETAIL(Degree of Explicitness in Textual Assembly for Instruction-based LLM Reasoning)框架,用于系统评估不同提示特异性水平下的模型表现。核心研究问题:探索提示特异性(从模糊到详细)如何影响LLMs在各类推理任务中的准确性,以及这种影响在不同模型、不同提示策略下的差异。研究方法:生成多水平提示:通过GPT-4生成高度详细的初始提示,再经迭代API调用将其逐步泛化为模糊程度递增的版本(3个水平:详细L3、中等L2、模糊L1),同时保持语义完整性。特异性量化:采用困惑度(perplexity)作为衡量指标,高困惑度对应详细提示,低困惑度对应模糊提示。多维度评估:在GPT-4和ChatGPT O3-mini两款模型上,结合基线、思维链(CoT)、规划-求解(Plan-and-Solve)、自一致性(Self-Consistency)四种提示策略,对涵盖数学应用题、逻辑谜题、常识推理等5类的30个全新推理任务进行测试;通过GPT-3.5的语义等价性判断计算模型输出的正确性。关键发现:提示特异性提升与模型准确率正相