过去我们衡量一个 AI 模型习惯看它会不会写代码、能不能答题。但 Anthropic 最近做了一件事把这个评价标准往后推了一步让 Claude 直接上手做科研。Anthropic 公布了一项实验——让 Claude 从头设计蛋白质结合剂。所谓蛋白质结合剂可以理解为一种能精准“抓住”目标蛋白的小蛋白是药物研发最早期的关键一步。结果是在 15 个可评价的靶点里Claude 命中了 14 个。**核心变化**AI 不再是“回答科学问题”的工具它开始“直接执行科研任务”。它不只是“算”而是“指挥”这件事最值得注意的不是 Claude 自己发明了什么新算法而是它的角色。设计蛋白质这件事过去要一群计算生物学家分工选结合位点、生成结构、设计序列、筛选候选……每一步都可能用到不同的专业软件还得有人判断下一步该往哪走。这一次Anthropic 只给了 Claude 一个约 3 万字的初始指令加互联网权限和 GPU。之后就不再插手让 Claude 自己决定结合位点自主调用结构生成、序列设计、共折叠等一整套专业模型跑完整个计算设计流程。换句话说Claude 不是那个“被调用的工具”而是那个“调用工具的人”。它像一位刚入职的研究主管把一堆现成的专业软件串起来自己推进项目。第三方盲测14/15 靶点命中光自己说好不算数关键是验证。Claude 设计的 1320 个蛋白被交给 Adaptyv Bio 和 Twist Bioscience 两家独立实验室去合成和测试。而且测试是“盲测”——实验室并不知道哪个蛋白是哪个模型设计的。结果354 个蛋白被确认能与目标结合。整体命中率在 22.6% 到 35.1% 之间而 Anthropic 估算这个领域的典型命中率大约是 10% 到 15%。在 RBX1 这个靶点上Claude 的命中率做到了 40%而此前同靶点竞赛里人类参赛者的平均命中率只有约 3.7%。更难得的是实验也把失败如实写了出来。有一个叫 MBP 的靶点90 个设计无一命中另一个靶点也只有微弱的结合信号。Anthropic 也专门强调蛋白质结合剂不是药物设计出一个高亲和力的结合剂只是漫长的药物研发路上的第一步。AI 做科研正在从“传言”变成“数据”除了设计蛋白质Anthropic 还测了 Claude 处理化学实验数据的能力。给它一份合同实验室的 NMR 和 LC-MS 原始文件Claude 分别在 23 分钟和 19 分钟内完成解析算出的样品纯度是 96.4%和实验室自己的 96.33% 基本一致。过程中它还发现谱图里的异常信号主动提出做一次重水交换实验——这个判断和实验室研究人员的独立判断恰好一致。这些结果当然还只是早期测试远没到“AI 能造药”的程度。但它的信号很清楚大模型正在从“回答科学问题”走向“直接处理科研任务”。这也给行业提了个醒——AI 的下一块价值洼地可能不在聊天窗口里而在实验室的仪器旁边。谁能先让 AI 真正“动手做事”谁就能打开一扇比“答题”大得多的门。而与此同时Anthropic 也把这类能力锁在了“可信访问”里提醒所有人能干的越多越要小心它被用错地方。