引言一场关于“知识”与“学习”的范式革命在人工智能的发展历程中很少有哪个概念像“端到端学习”这样既代表了技术的巨大进步又引发了关于“人类知识是否还有价值”的深刻讨论。想象一下这样的对比在传统机器学习时代要训练一个识别猫的模型你需要先定义“边缘”“纹理”“颜色直方图”等特征再让算法基于这些特征学习分类。而在深度学习时代你只需要把数百万张猫的图片直接输入神经网络模型自己就能学会“猫长什么样”。这个差异看似简单却折射出AI方法论的一场深层革命。所谓端到端学习End-to-End Learning指的是用一个神经网络从原始输入直接映射到最终输出所有中间环节——包括特征提取、表示学习、决策判断——都由模型自动完成无需人工设计中间步骤。在图像识别领域这意味着输入是像素输出是类别在语音识别领域输入是声波信号输出是文字在通信系统领域输入是信息比特输出是恢复后的消息。这场革命之所以能够发生有三个关键的推动因素大数据的可用性让模型有机会从海量样本中“领悟”规律算力的飞跃使训练数百万参数的深度网络成为可能算法本身的进步如反向传播、卷积神经网络、Transformer提供了实现自动特征学习的工具。然而端到端学习的崛起也引发了一个尖锐的问题人类工程师数十年积累的特征工程知识就此被淘汰了吗答案远比“是”或“否”复杂。本文将从端到端学习的原理出发对比手工特征工程与自动特征学习的优劣分析端到端学习的适用边界和局限性并探讨人机协作的新范式——物理引导学习等前沿方向如何将人类知识与数据驱动结合起来。一、手工特征工程曾经的“工匠艺术”1.1 什么是“手工特征”在深度学习成为主流之前几乎所有的机器学习应用都遵循一个固定流程原始数据 → 特征提取 → 特征选择 → 模型训练 → 预测输出。其中特征提取和特征选择是整个流程中最关键、最耗时的环节。特征Feature是描述数据对象的独立可量化的属性。以预测房价为例特征可以是房屋面积、房间数量、地理位置等以识别图像中的物体为例特征可以是边缘检测值、颜色直方图、纹理描述子等。手工特征工程Handcrafted Feature Engineering指的是人类专家依靠领域知识人为设计这些特征的计算方法将原始数据转换为算法能够有效处理的形式。在医学影像分析领域手工特征的发展尤为成熟。以影像组学Radiomics为例专家们设计了多类特征来量化医学图像中的信息一阶统计特征描述图像中像素强度值的分布如均值、方差、偏度、峰度等二阶纹理特征通过灰度共生矩阵GLCM等工具量化像素之间的空间关系揭示图像的均匀性、随机性和线性依赖高阶特征包括灰度游程矩阵GLRLM量化连续相同灰度像素的游程长度、灰度区域大小矩阵GLSZM量化灰度级变化和区域同质性等变换域特征通过Gabor变换、小波变换、方向梯度直方图HOG、局部二值模式LBP等方法提取频域或梯度域信息。每一类特征都凝聚了研究者对特定领域问题的深刻理解。在微波乳腺成像中工程师会基于电磁波与不同组织相互作用的物理原理设计特征恶性组织通常具有更高的介电常数和电导率导致更强的反射或改变的传播模式因此特征可以包括频率相关的能量衰减、跨天线对的相位差、信号不对称性等。1.2 手工特征的优势手工特征工程虽然耗时费力但它的价值在特定场景下难以被取代主要体现在三个方面第一数据效率高。手工特征将原始数据从高维空间压缩到紧凑的低维表示大大减少了模型需要学习的参数空间。在医学影像等样本稀缺的领域这是一个决定性的优势。影像组学特征提取在小样本上就能获得较好的效果而深度学习模型需要数千张图像才能避免过拟合。有研究指出在二分类问题中每条样本至少可以支撑10个特征这比端到端模型所需的训练数据少几个数量级。第二可解释性强。手工特征通常是可理解、可追溯的。当模型判断一个肿瘤为恶性时临床医生可以回溯到具体哪些纹理特征、哪些强度指标主导了这个判断进而验证模型的推理是否合理。这种透明性在医疗诊断、金融风控等高问责场景中至关重要。第三融入了人类专业知识。手工特征本质上是将人类对问题的理解“编码”进特征设计中。如果这种理解是正确的、有生物学或物理学依据的那么特征本身就具有先验价值能够引导模型关注真正有意义的信息。1.3 手工特征的局限然而手工特征工程也有一系列难以忽视的缺陷正是这些缺陷为端到端学习的崛起埋下了伏笔。局限性之一是“可能遗漏关键信息”。人类设计的特征基于已有的知识和假设但如果这些假设不成立或者数据中存在人类尚未意识到的模式手工特征就会丢失重要信号。正如一句业界名言所说“特征工程的最大问题在于你得先知道你要找什么而真正有价值的信号往往是那些你没想到要去找的东西。”局限性之二是“泛化能力不足”。手工特征往往针对特定数据集、特定采集协议设计一旦数据分布变化、设备更换、协议调整特征的表现就会大打折扣。在医学影像领域影像组学特征被证明对成像参数如空间分辨率、量化级别、重采样设置和特征提取软件的差异非常敏感缺乏鲁棒性。局限性之三是“特征冗余和维度灾难”。当你为同一个问题设计了数百个特征时其中很多是冗余的、高度相关的或者对预测任务没有实际贡献。特征选择本身就是一个复杂的问题——在样本量有限的情况下特征越多模型越容易过拟合。这被称为“维度灾难”是传统机器学习的一个核心难题。局限性之四是“设计成本高昂”。每一个问题的特征都需要领域专家投入大量时间进行设计、实验、调优。计算机视觉中的SIFT、HOG、LBP等特征背后是研究人员数年的心血。当你从“识别猫”切换到“识别狗”时这些特征不一定适用一切可能需要重来。二、端到端学习让神经网络自学成才2.1 什么是端到端学习端到端学习的核心思想是用单一的深度神经网络完成从原始输入到最终输出的完整映射将特征提取、表示学习和决策预测整合为一个统一的优化过程。与传统机器学习需要手工设计特征不同端到端学习的神经网络通过多层非线性变换自动从原始数据中学习层次化的特征表示。浅层网络可能学习到边缘、颜色斑块等低层特征中间层学习到形状、纹理等中层特征深层网络则学习到语义概念、对象部件等高层特征。整个过程无需人类干预。在通信系统领域端到端学习有更具体的形式。一个通信系统可以被视为一个自编码器Autoencoder发射端编码器将信息映射为传输信号信道对信号产生各种畸变和噪声接收端解码器将接收到的信号恢复为原始信息。整个系统可以用神经网络统一表示和训练。端到端学习在多个领域已经展现出令人惊叹的成果计算机视觉AlexNet2012用8层卷积神经网络直接从图像像素学习分类在ImageNet竞赛中夺冠。此后的ResNet、EfficientNet等模型将这一范式推向极致。自然语言处理从Word2Vec到BERT再到GPT系列语言模型从词嵌入到语义理解全部由神经网络自动学习无需人工设计词性标注、句法分析等中间特征。语音识别端到端模型直接接收声波信号的频谱图输出对应的文字跳过了传统的音素识别、语言模型拼接等中间步骤。自动驾驶英伟达的端到端驾驶模型直接从摄像头图像输出方向盘转角绕过了“车道检测→物体识别→路径规划”的传统管线。2.2 端到端学习的核心优势优势一保留信息的完整性。手工特征本质上是信息的有损压缩——你只保留了“你认为重要”的信息丢弃了“你认为不重要”的信息。但真正的挑战在于你并不知道什么信息最终是有用的。端到端学习则保留了原始数据的所有信息让模型自己决定关注哪些信号、忽略哪些噪声。在微波成像中原始S参数包含电磁波与组织相互作用的完整信息包括散射、衰减、相位变化等复杂效应这些在手工特征提取过程中可能会被部分丢弃。优势二发现人类难以预见的模式。神经网络的强大之处在于它能从数据中发现人类专家未必意识到的复杂关联。在医学影像领域有研究指出可解释的深度模型如果解释正确有可能揭示出人类专家未曾发现的、与疾病相关的新信息。这意味着端到端学习不仅是一个工程工具还可能是科学发现的引擎。优势三任务适配能力强。端到端模型是端到端地针对最终任务优化的而非针对中间特征优化。这意味着模型的每一层都在为最终目标服务而不是为某个预设的中间目标服务。这种“全局优化”特性往往能带来更好的任务性能。在光学通信系统中物理引导的端到端学习方法通过让前向传播在实际物理信道上执行确保了输出包含了所有真实信息包括噪声、残余效应、非可微操作从而提升了整体精度和有效性。优势四可扩展性好。当数据规模增大时端到端模型的性能会持续提升而手工特征模型往往会在某个点上“饱和”。这也是为何大模型时代端到端学习成为绝对主流的原因——只要有足够的数据和算力端到端模型的性能上限远高于传统方法。三、端到端不是银弹四个无法回避的挑战尽管端到端学习在多个领域取得了统治地位但我们必须清醒地认识到它不是万能的更不是“手工特征”的终结者。在某些场景下端到端方法甚至表现得比传统方法更差。3.1 数据的“饕餮之胃”端到端深度学习最显著的局限是它对数据的“贪婪”。深度神经网络动辄包含数百万乃至数十亿个可训练参数需要海量的数据来稳定地估计这些参数。当训练数据有限时模型极易陷入过拟合——在训练集上表现出色但在新数据上泛化能力很差。在医学影像领域这个问题尤为突出。许多疾病的数据集规模只有几百例远不足以支撑一个深度模型的训练。而手工特征方法在中小样本上就能获得不错的效果因为特征提取本身已经对数据进行了降维和正则化。有研究明确指出“在样本量有限的情况下手工特征提取相比深度特征提取具有明显优势。”即便数据量足够“数据的多样性”同样重要。如果训练数据只来自单一设备、单一人群模型在面对新设备、新人群时可能表现急剧下滑。深度学习模型“只学到过拟合而非真正理解”的风险始终存在。3.2 可解释性的“黑箱困境”深度学习的“黑箱”问题也许是它最受诟病的弱点。当一张医疗影像被端到端模型判断为“恶性”时医生很难知道模型到底看到了什么——是真正的肿瘤特征还是某个与疾病无关的伪影这种不透明性严重制约了深度学习在高风险领域的临床应用。相比之下手工特征模型具有天然的可解释性优势。医生可以检查模型使用了哪些纹理特征、哪些强度分布来做出判断进而验证这些判断是否有生物学依据。有观点认为即便在深度学习的黄金时代“当可解释性被高度重视时手工特征模型仍然可能是更优选择。”可解释性不仅是合规需求也是信任的前提。在医疗、金融、司法等与人类生命财产直接相关的决策中我们很难接受一个无法解释其推理过程的“黑箱”系统。3.3 物理知识与先验的“失语”端到端学习完全依赖数据驱动它不“知道”任何物理定律、生物学规则或领域常识。在物理和工程领域这意味着它可能学习出违反物理规律的映射或者忽略已知的物理约束从而在不熟悉的场景中表现失常。以微波成像为例电磁波的传播和散射遵循明确的物理定律麦克斯韦方程组。如果在一个完全数据驱动的端到端模型上训练模型需要从数据中“重新发现”这些物理规律——这不仅低效而且在数据不足时可能失败。而将物理知识编码为特征或约束条件的手工方法则能更高效地利用有限数据。这一挑战催生了一个重要的前沿方向物理引导学习Physics-Guided Learning将人类知识和物理先验“注入”端到端训练过程下文将详细讨论。3.4 计算成本的“奢侈税”端到端学习需要从头训练一个庞大的神经网络计算成本高昂。训练一个GPT级别的模型需要数千颗GPU运行数月电费以千万元计。即便在更小的应用场景中从头训练一个端到端模型也远比使用预定义特征加简单分类器的组合昂贵。在医疗等资源有限的领域这种计算成本可能构成实际障碍。同时端到端模型的推理也往往比手工特征模型更慢、更耗能限制了它们在边缘设备、实时系统中的应用。四、折中与融合不是替代而是进化4.1 从“非此即彼”到“兼收并蓄”面对上述挑战学界和产业界正在形成一个新的共识端到端学习和手工特征工程并非对立关系而是可以互补共存。这场革命的真正价值不在于“消灭”特征工程而在于重新定义人类知识与数据驱动之间的边界。一个最直接的融合策略是混合模型——将手工特征和深度学习特征结合起来以发挥各自优势。例如在医学影像中可以将提取好的影像组学特征输入到深度神经网络的某个中间层与自动学习的特征共同参与决策或者将深度模型和手工特征模型的预测结果进行集成得到更稳健的最终输出。这种混合思路在微波成像领域也有体现。研究者尝试将物理推导出的特征输入深度网络或将重建的图像与原始信号输入结合设计尊重天线几何结构或采集架构的网络结构。4.2 物理引导学习知识与数据的交叉点物理引导学习Physics-Guided Learning是近年来在通信系统和物理信号处理领域兴起的一个前沿范式它提供了一个思考“如何让端到端学习利用人类知识”的优雅框架。传统端到端学习需要对整个系统如通信信道建立精确的数学模型才能通过反向传播计算梯度。但现实中的物理系统往往极其复杂、充满噪声、甚至包含不可微操作如量化精确建模几乎不可能。物理引导学习的创新之处在于前向传播在实际物理系统上执行确保输出包含了所有真实信息而反向传播则使用一个简化的物理模型白盒模型来估计梯度。这个方法有几点值得注意第一它允许前向传播的“真实系统”和反向传播的“代理模型”不必相同。论文指出只要代理模型估计的梯度与实际系统梯度之间的夹角小于90度训练过程就能收敛。这意味着代理模型可以被大幅简化大幅降低计算复杂度。第二它的效果出奇地好。在光通信系统的数字预失真DPD实验中物理引导学习相比传统数据驱动方法减少了80%以上的训练迭代次数同时在不同调制格式、不同传输距离下都表现出更强的泛化能力和抗噪性能。第三它为更广泛的物理系统和工程问题提供了一种人机协作的新范式人类提供物理定律和领域知识以白盒模型的形式神经网络在真实数据上学习和优化两者相互补充而非相互替代。4.3 混合方法的未来从更广阔的视角看端到端学习与手工特征工程的融合正在多个层面展开特征注入将手工特征作为深度网络的辅助输入让模型同时利用先验知识和自动学习的表示。架构设计设计尊重领域结构如物理对称性、几何约束的网络架构将人类知识编码在网络结构而非特征中。数据增强与合成利用物理模型或领域知识生成合成数据弥补真实数据的不足。可解释性增强用深度学习“发现”新的特征模式然后将其“翻译”为可解释的手工特征实现“AI辅助的人类知识发现”。这些探索说明端到端学习并非手工特征工程的终点而是对其角色的重新定义。人类专家不再需要亲自设计每一个特征但他们仍然需要设计学习算法、架构约束、物理先验、数据策略和评估框架。结语当机器学会“自学”人类该做什么端到端学习的兴起本质上是从“教机器如何看”到“让机器自己学会看”的转变。这种转变极大地降低了AI应用的门槛让非专家也能在大量数据的支持下构建强大的模型。更重要的是它让AI能够发现人类未曾预见的数据规律开辟了科学发现的新路径。但我们也必须看到端到端学习并没有让人类知识变得多余。相反它重新定义了人类知识发挥作用的方式。在数据稀缺时手工特征仍然是不可或缺的工具在需要可解释性时它可能比黑箱模型更受青睐。当数据充足时深度特征往往表现更优但将两者结合的混合方法正在成为新的“最优选择”。“物理引导学习”等前沿方向的启示是最好的系统不是完全依赖数据也不是完全依赖人类知识而是找到两者最佳的交叉点。人类提供物理定律、领域知识、架构约束白盒模型神经网络在真实数据上学习和适应两者形成一种相互强化而非相互替代的关系。这也许就是端到端学习革命的核心启示当机器学会了自学人类的工作不是退出而是从“设计特征”转向“设计学习机制本身”。特征工程不会消失但它会从一项“工匠艺术”演变为一种“架构艺术”——而我们每个人都正在见证并参与这场转变。参考文献Image biomarkers and explainable AI: handcrafted features versus deep learned features.European Radiology Experimental, 2024.Should end-to-end deep learning replace handcrafted radiomics?European Journal of Nuclear Medicine and Molecular Imaging, 2025.Concept and experimental demonstration of physics-guided end-to-end learning for optical communication systems.Photonics Research, Vol. 13, Issue 6, 2025.Microwave Signal Structuring: Features vs End-to-End.Sogeti Labs, 2026.机器学习过程特征、模型、优化和评估. 数据派THU, 2025.