Fable 5.1这周鸽了,但A社再次甩出了王炸。

今天,是值得载入大模型史册的一天。
AI,终于长出手,接管物理世界了!
A社最先拿自家Claude「试水」,让它去真正操控实验室的硬件。
机械臂、液体处理仪、显微镜、摄像头,甚至量子计算机的激光系统,全部可以直接上手。

通过不断优化移液器的设置,Claude在药物发现中自主跑实验,修bug。
更疯狂的是,一项原本需要耗费数周的成像实验,也被AI硬生生压缩到了1天之内。

就在这一刻,A社直接把这项「标准」——MHS(模型硬件标准),开放第一阶段研究预览。

一时间,全网炸开了锅。有人认为,这可能是今天最被低估的发布之一。
MHS,就相当于「硬件版MCP」,真正给AI装上了眼睛和双手!


MCP,A社最重要发明之一,无人不知。
它的出现,为如今的大模型接上了数据库、浏览器和各种软件工具。
如今,A社又把这一思路,同样搬到了现实世界。

MHS(模型硬件标准),就是一个「通行证」,Agent可直接上手去操控现实中的硬件。
这可和上半年爆火全球「龙虾」不同,那一次还只停留在工具层面,这一次是AI真的接入硬件了!

A社想做的,是让所有机器,都可以被大模型「读懂」。
毕竟,实验室自动化听起来早就不新鲜了。真正磨人的,一直是设备接不起来。
一个实验室里,显微镜来自一家厂商,机械臂来自另一家,移液工作站又使用另一套接口。
每多接一台机器,工程师就要重写一套「翻译程序」。
所以,搭好一套自动化的实验流程,往往需要数周甚至数月。MHS的出现,直接把桌子掀了。


MHS是物理世界的MCP,也是AI设备时代的USB-C
只要设备有个编程接口,MHS就能用极简指令,让所有硬件都能听懂AI在说什么。
最离谱的是,它自带「大白话说明书」。
比如一台新机器接上来,AI只需要读一下这台硬件自研语言标签——
这台仪器最多能加热到几度,机械臂有多重,最大速度是多少......
全世界的AI便能瞬间,掌握一台它这辈子都没见过的机器!
等设备全部接好,Agent就能通过MCP、命令行或API统一调度。不同机器,终于可以在同一工作流协同工作。


MHS听着或许抽象,看完Claude被丢进实验室的战绩,便一目了然。
一家量子公司QuEra,其中性原子量子计算机,需要用激光精准控制原子量子比特。
这些激光非常「娇贵」,频率一旦漂移,机器就可能停摆。
有些故障,人类专家修一次要5-10分钟。新工作的调试,还要拖上几个星期。

QuEra曾让4名专家连轴转了两三周,手搓出一套恢复Python脚本。结果,这套程序只能预设的故障。
他们又把同一道题,扔给了Claude。
通过MHS,Claude直接读取了「激光系统」的状态,在专用测试台上调节参数,再通过摄像头观察光束有没有回到正确的位置。
就这样,Claude跑了整整一晚,主动制造、识别和修复了数百种故障情况。

最后成绩非常亮眼,Claude直接把激光稳定率,干到了99.3%。而人类专家仅58%。
令人震惊的是,同样一次校准,人上手要5-10分钟,Claude练熟之后直接压到6秒。

另一家基因公司Genentech,同样让Claude去做药物发现实验。
没想到,Claude全程自己给自己打分,还能不断优化优化移液器的设置,出bug还能实时自我修复。
在HHMI Janelia研究园区,一项极其复杂的「脑成像」实验,团队平时搞完要花好几周。
Claude接管多设备后,直接一天收工。


HuggingFace研究员LeRobot也提前内测了MHS研究预览版。
令他惊叹的是,未经过任何训练,Claude Code直接操控一台真实的机械臂,完成了积木颜色分类的任务。


评论区下,网友表示,简直难以置信,这种泛化从何而来。

当然,现在就宣布「黑灯实验室」真正到来,还太早。
成绩固然亮眼,在实验记录中我们也能看到肉眼可见的局限性。
Genentech做蛋白浓度检测时,粘稠的蛋白溶液在移液过程中起泡,气泡挤占管道空间,实际转移量偏低。

Claude 的本能反应是在同一孔位重试,结果液体越搅泡沫越多...
研究人员不得不上手亲自告诉它:「这是物理问题,不是算法存在 Bug,你得换个干净孔位、减少混合次数才行。」
Claude听懂后保持了正确操作,但它自己始终想不到这一步。

这是MHS目前最根本的瓶颈:Claude通过文本和图像理解世界,没有物理直觉。
换言之,我们需要真正的世界模型!
QuEra的测试同样印证了这一点:Claude能一夜跑完数百次激光校准,但遇到光束被物理遮挡,只会停下来等人确认,实验可能在凌晨空转数小时。

这看起来也未免太蠢了...
安全第一,谨慎有余,效率不足。
这也是具身智能目前很大程度上的困境。
物理推理之外,还有三道现实门槛
第一,设备覆盖。
MHS只能接管有编程接口的硬件。
CMU的案例里,一台板式读数仪连API都没有,MHS只能模拟人类点击GUI 来操作,这大大制约了在全球实验室能真正落地的自动化效率。

祖传老设备才是大多数实验室的常态。
第二,计算成本。
让AI持续在线监控,计算开支需要和省下的研究时间放在一起权衡。
对预算紧张的学术实验室,这不是小数目。
毕竟,一个月2000块,你就可以得到一个超高学历的能工智人,任劳任怨,还能为教授提供情绪价值。

Claude API价格
第三,监管真空。
MHS 的工作方式,是在驱动文件里写清楚一台机器的安全边界。
比如这条机械臂最快只能转多快、最大角度是多少,AI读完就知道哪些动作不能做。
问题在于,这份文件本质上就是一道安全阀:写对了,机械臂不会撞到人,很好;可写错了,后果由谁承担?目前没有标准答案。
想要大规模真实落地,把法律责任捋清楚很重要——但也可能会反过来影响技术的实现,为了安全而妥协一部分。
世界的底层接口
这一次,A社想要争夺的,是AI进入物理世界最底层的「接口」。
在这个Agent时代,它先用MCP连接起工具,现在又用MHS打通AI进入真实世界的大门。
过去,大模型只能告诉人类怎么做。现在,它开始亲手做了。
参考资料:
https://www.anthropic.com/news/model-hardware-standard-research-preview
文章来自于"新智元",作者 "桃子 马可"。
【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!
项目地址:https://github.com/coze-dev/coze-studio
【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。
项目地址:https://github.com/n8n-io/n8n
在线使用:https://n8n.io/(付费)
【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。
项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file
【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。
项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file
在线使用:https://vectorvein.ai/(付费)
【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。
项目地址:https://github.com/Significant-Gravitas/AutoGPT
【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。
项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md