自动驾驶出行为何是早期预警系统自动驾驶出行常被视为一个专业细分领域实际上它应被当作一个早期预警系统。图片来源Shutterstock/Iv - olga多年来人工智能的进展一直以规模来衡量即更多的数据、更大的模型和更强的计算能力。这种模式确实带来了实质性的突破但自动驾驶出行是最早发现其局限性的行业之一。在路上人工智能一旦出错后果显而易见。误判场景、行人做出模糊手势或者遇到与先前示例不符的施工区域都可能立即带来明显的风险。这种压力迫使自动驾驶出行团队直面一个现实而现在整个企业级人工智能领域也开始面临这一现实最棘手的问题并非获取模型而是可靠的真实数据基准ground truth。随着人工智能从试点项目进入生产系统企业发现系统性能不仅取决于模型能力还取决于用于训练、评估和改进这些系统的数据的质量、一致性和可信度。生产环境中规模神话为何破灭早期的自动驾驶汽车开发遵循着一种常见模式收集更多数据、训练更大的模型然后随着时间推移提升性能。这种方法在一定程度上是有效的但现实世界的驾驶数据与基准测试数据不同。道路环境杂乱且不可预测人类行为缺乏一致性场景变化迅速。许多情况即使是训练有素的人类观察员也难以判断。随着数据集不断增大团队常常发现他们不仅在收集更多有效信息也在收集更多相互矛盾的内容。不同团队对同一场景的解读各不相同极端情况不断累积模糊性成倍增加。规模有时非但没有带来清晰的结果反而造成了混乱。同样的情况如今也在企业级人工智能领域不断重演。企业能够使用功能日益强大的基础模型但许多人工智能项目在部署到生产环境时仍面临困境。生产环境会暴露一些基准测试中很少能发现的弱点比如数据不一致、模糊的极端情况、不断变化的场景以及模型行为与人类预期之间的差距。结果就是模型获取能力与实际运行可靠性之间的差距越来越大。更多的数据仍然有价值但前提是这些数据经过精心整理、统一解读并与明确的业务定义相关联。在许多生产环境中低质量或解读不一致的数据所带来的干扰模型往往难以快速消除。现实世界的人工智能为何本质上是多模态的自动驾驶出行还揭示了另一个正在人工智能领域蔓延的现实现实世界的智能是多模态的。汽车不能仅通过图像来理解道路情况它必须将摄像头图像、激光雷达LiDAR数据、雷达信息、地图、定位信号、行驶历史、天气状况和人类行为等信息整合起来形成对场景的连贯解读。同样的要求也出现在其他高风险的人工智能领域。在医疗保健领域系统可能需要关联医学影像、临床笔记、实验室检测结果和患者病史在农业领域模型可能会结合卫星图像、无人机拍摄画面、土壤数据、天气模式和实地观察情况在制造业和机器人领域人工智能系统越来越需要综合分析视频、传感器遥测数据、三维空间数据、维护日志和人类指令。这就提高了对真实数据基准的要求。现在的问题不再仅仅是图像中的物体是否标注正确或者文本回复是否准确更难的问题是系统能否通过多种信号正确理解某个场景而这些信号中有些可能是不完整、有干扰、相互矛盾或随时间变化的。多模态人工智能不仅需要对齐的数据集还需要统一的解读而这无法在模型构建完成后再进行调整。极端情况为何并非个例自动驾驶领域最重要的经验之一就是极端情况并非问题的一小部分在高风险的人工智能应用中它们本身就是问题所在。人工智能系统通常在平均情况下表现良好但现实世界的系统往往会在特殊情况面前失效。在自动驾驶领域这些特殊情况可能包括行人行为不可预测、施工区域与先前示例不符、物体部分被遮挡、不寻常的道路几何形状或者人类意图不明确的交互场景。这些情况在总驾驶事件中所占比例很小但却占据了大部分风险。同样的原则也适用于自动驾驶之外的领域。在医疗保健领域可能是罕见的疾病症状在金融领域可能是不寻常的交易模式在制造业可能是前所未有的操作条件组合在机器人领域可能是在模拟中看似简单但在现实世界中表现不同的物理交互。企业常常发现要实现最后那一点点可靠性提升所需的努力远比提升前 90% 的性能要多得多。这最后的差距正是许多团队陷入“爬坡困境”的原因即投入巨大的精力却只换来越来越小的收益。在多模态系统中这种影响会更加明显。每增加一个传感器数据流都会带来新的极端情况组合而调和相互冲突的信号则需要专家的判断。真实数据基准为何必须可信而非仅仅标注那些处理得当的自动驾驶汽车项目认识到真实数据基准不能被视为静态输入如标签、边界框或分类。在关键场景中对场景的正确解读需要经过推理、跨传感器数据流进行协调并能抵御其他不同的解读。同样的标准现在也适用于其他关键领域。医学标注可能需要将影像检查结果与临床背景相结合金融模型的训练数据可能需要考虑监管意图而不仅仅是交易模式在非结构化环境中运行的机器人系统可能需要真实数据基准来记录事件的因果链而不仅仅是发生了什么。在这些情况下真实数据基准不仅仅是标注好的数据而是经过结构化处理、审核并通过专家判断验证的数据。它不仅要说明正确答案是什么还要解释为什么这个答案是正确的。这种区别很重要因为人工智能系统越来越多地在对准确性要求极高的环境中运行。用例越关键创建一致、可审计且具有实际业务意义的真实数据基准就越重要。为何会从标注到判断转变如今人工智能领域最重大的变革或许就是人类参与方式的演变。数据标注行业正从简单的众包标注转向更专业的工作如场景设计、故障分析、模型评估、红队测试、推理验证和极端情况识别。这项工作需要那些理解场景、模糊性、意图和风险的专业人员。在高风险环境中关键问题不仅仅是系统是否得出了正确答案企业还需要了解系统为何会如此运行这种行为是否可以解释以及如何在未来避免类似的故障。信任不能仅仅通过营销、界面设计或事后解释来建立它需要在数据创建、训练、评估、监控和审计的整个生命周期中进行前期设计。一个看似正确的模型和一个运行可靠的模型之间的区别往往在于开发过程中是否系统地融入了专家判断。软件提供规模专业知识提供判断可靠的人工智能两者都需要。自动驾驶出行给其他人工智能领域带来了哪些启示自动驾驶出行常被视为一个专业细分领域实际上它应被当作一个早期预警系统。它展示了当人工智能进入错误成本高昂、极端情况主导风险、必须正确解读多模态证据且不允许不透明决策的环境时会发生什么。而这正是企业级人工智能在医疗保健、金融、关键基础设施、机器人、农业和其他高风险领域正在迈向的方向。自动驾驶的经验教训不仅适用于汽车行业它表明现实世界的人工智能必须同时处理模糊性、极端情况和多模态证据。模型可以生成输出但定义什么是可接受的结果仍然是人类和业务层面的决策。应用人工智能的下一次重大飞跃不仅仅取决于模型规模还取决于能够创建、验证和持续完善可信真实数据基准的系统。这些系统依赖于三个要素高质量数据、专家判断和规范的业务流程。那些能尽早认识到这一点的企业在人工智能从令人印象深刻的演示走向可靠的现实世界系统的过程中将具有显著的优势。自动驾驶出行领域最先领悟到了这一点。数据管理、人工智能、生成式 AI、软件开发