金融科技架构师如何打造稳健可靠的AI智能体系统
在近期于纽约举办的AICamp技术交流会上多位来自金融科技领域的从业者分享了他们在实际应用中构建AI智能体的经验强调架构决策、系统耐久性与有效监管是落地的关键所在。FICO全球解决方案架构师李昊、Diagrid联合创始人兼首席技术官雅龙·施耐德以及StoneX集团高级软件工程师亚当·赫斯特分别介绍了各自团队如何将早期粗糙的AI智能体工具打磨成更可靠的生产级系统。AI智能体凭借只需少量输入即可主动甚至自主运作的特性赢得了广泛关注。但目前仍处于发展早期智能体有时会产生意料之外的行为这与强监管的金融行业的要求存在明显冲突。从原型到生产的鸿沟李昊指出过去十年间金融行业的大量架构决策都是针对确定性系统设计的而AI智能体并不在这样的体系中运行这意味着必须制定全新的规则体系。我们必须学会在智能体推理边界与确定性架构之间划清界限并将两者有效连接起来。他说。借助大语言模型金融科技团队已经能够在一天之内生成一个原型——但真正的挑战在于将其推向生产环境。届时工程师需要应对局部故障、审计需求与多智能体协同问题同时还要管理概率性输出。为此李昊建议重点关注四个方面原型阶段有效的内容、其对生产环境的影响、两者之间存在的差距以及需要为此做出哪些新的架构决策。他还特别强调在金融服务领域治理问题应在原型阶段就纳入考量因为监管机构必然会对最终进入生产的内容提出质疑。构建具备容错能力的关键业务智能体施耐德坦言他在使用AI智能体时仍面临不少挑战因为智能体有时难以准确理解用户意图。他强调智能体实验在进入生产之前必须具备足够的健壮性。我喜欢把粗糙的系统打造成真正有韧性的东西。在联合创立Diagrid之前施耐德曾在微软担任Azure容器应用的首席软件工程师。他观察到当前市场上存在大量智能体框架但它们有一个共同特点——都只解决相对简单的问题。智能体通常只是创建一个简单的循环不断重复执行某项任务直至完成。真正困难的是将这些简单能力整合并投入实际运营而这恰恰是智能体容易失效的环节。施耐德用晨间通勤作比喻若其中某个环节出了问题比如地铁故障你就不得不从头开始重新准备代价极大。这本质上就是AI智能体在生产环境中面临的困境。他特别指出在智能体失败后反复重启不仅会导致运营失控还会带来巨额大语言模型调用费用。他建议为智能体配备持久化执行引擎使其在失败时能够保存上下文并从断点处继续执行而不是从头开始从而有效控制成本。为集成与并购场景设计系统赫斯特介绍StoneX是一家横跨农业大宗商品、贵金属、股票和证券等领域的金融服务机构百年来通过大量并购实现了快速扩张如何在各异构系统之间建立统一协作机制始终是一大挑战。为避免陷入集成债务的泥潭StoneX团队采用了统一的运行时方案选择了开源分布式运行时系统Dapr——这一项目正是由施耐德在微软任职期间联合创建的。2020年对Gain Capital的收购是其中最为复杂的一笔。由于Gain Capital此前已完成近十家公司的整合这次收购实际上带来了多达11套已被他人整合过的企业系统。为应对这一挑战StoneX团队开发了名为Overwatch的监控产品用于统一监管这些分布式任务与流程。该系统托管Dapr工作流无需自建数据库却能保障系统的全局可见性与可审计性有效管理跨多个主机独立运行的数百个工作流。统一运行时真正改变了我们的编码方式……我们采用Dapr不是为了少写代码而是为了减少需要自己拥有和维护的代码量。赫斯特说道。QAQ1AI智能体在金融行业落地时面临哪些主要挑战AAI智能体在金融行业落地面临多重挑战。首先金融行业此前的架构大多针对确定性系统设计与AI智能体的概率性输出存在根本冲突。其次从原型到生产环境的跨越需要处理局部故障、多智能体协同和审计合规等问题。此外监管机构对进入生产的系统有严格要求治理机制必须从原型阶段就纳入考量。智能体的不可预期行为也与金融行业的强监管要求难以兼容。Q2智能体失败后反复重启为什么会导致高昂成本A当AI智能体在执行过程中发生故障并从头重启时之前已完成的所有大语言模型调用都会被重新执行而每一次大语言模型调用都会产生费用。如果智能体反复失败、反复重启就会不断累积调用费用最终导致成本失控。施耐德将这种情况形象地称为破产的好方法。他建议为智能体配备持久化执行引擎在失败时保存上下文从断点处继续执行以避免重复计费。Q3StoneX开发的Overwatch系统是什么有什么作用AOverwatch是StoneX团队基于Dapr开发的一套分布式作业监控产品用于统一管理和监控跨多个主机运行的数百个分布式工作流。它本身不维护独立数据库但能提供全局可见性和可审计性确保各类分布式任务和流程处于有效监管之下。这一工具在StoneX完成大量并购后帮助团队有效整合了来自多家公司的异构系统显著降低了系统维护的复杂度。