
1.3B激活参数硬刚31B!蚂蚁开源本地Agent新模型,MacBook可跑。
智东西8月11日报道,今日,蚂蚁百灵大模型开源了一款轻量级混合推理MoE模型——Ling-3.0-tiny。
该模型总参数量为7.9B,推理时激活参数量为1.3B,主要面向高效本地部署而设计。其同步提供BF16、FP8和INT4三个版本,已在DGX Spark、MacBook、Mac mini等设备上完成验证,兼顾性能、效率与可部署性。

在Artificial Analysis Intelligence Index评价体系中,Ling-3.0-tiny获得25分,仅比Gemma-4-26B-A4B低1分,同时高于gpt-oss-120B(high)、Qwen3.5-9B、Gemma-4-12B和Gemma-4-E4B。
该模型的关键要点总结如下:
1、高效的混合线性架构:Ling-3.0-tiny采用月之暗面自研的KDA(Kimi增量注意力)与DeepSeek自研的MLA(多头潜在注意力)的3:1 交替堆叠结构,并配备由128个路由专家组成的稀疏MoE前馈网络,构建起高效的混合线性架构。
每个Token仅激活8个路由专家和1个共享专家,使该模型能够在长上下文建模能力、参数效率与计算成本之间实现平衡。
2、原生混合推理与智能体能力:Ling-3.0-tiny兼顾快速响应与多步推理能力,可通过enable_thinking参数在单次请求中灵活开启或关闭思考模式。该模型在通用智能体任务、代码生成、数理科学推理以及指令遵循场景下均具备均衡表现。
3、本地与边缘部署:在FP8精度下,Ling-3.0-tiny在DGX Spark上的推理吞吐量可达100–105tokens/s,而在M4 Pro MacBook上则为86–90tokens/s,且在8K上下文长度时,峰值内存占用仅为8.34GiB。
如下面视频所示,百灵在36GB内存MacBook Pro复刻Infinite Wiki(无限百科)核心体验。用户阅读时点击词语即可生成上下文解释卡片,支持多层知识下钻。
该Demo全程本地推理,无需云端调用,实测首Token响应低于100毫秒;所有数据留存设备端,不会产生云端API计费,接近一个原生速度的本地知识引擎。
Hugging Face地址:
https://huggingface.co/inclusionAI/Ling-3.0-tiny
https://huggingface.co/inclusionAI/Ling-3.0-tiny-fp8
https://huggingface.co/inclusionAI/Ling-3.0-tiny-int4
ModelScope地址:
https://modelscope.cn/models/inclusionAI/Ling-3.0-tiny
https://modelscope.cn/models/inclusionAI/Ling-3.0-tiny-fp8
https://modelscope.cn/models/inclusionAI/Ling-3.0-tiny-int4
1.3B激活参数“以小博大”
评分紧咬26B大模型
在Artificial Analysis Intelligence Index评价体系中,Ling-3.0-tiny获得25分。该指数从真实任务、工具使用、代码、科学推理、知识可靠性和长上下文等九个方向,综合衡量模型的跨任务能力。
百灵公布的对比结果显示,Ling-3.0-tiny的综合得分仅比Gemma-4-26B-A4B低1分,接近激活参数约4B的更大MoE模型,同时高于gpt-oss-120B(high)、Qwen3.5-9B、Gemma-4-12B和Gemma-4-E4B。
Ling-3.0-tiny拥有7.9B总参数,但每个Token仅激活1.3B参数。这意味着,它以较低的实际计算规模,进入了主流4B至12B级模型的综合能力区间。
单项分数无法覆盖模型的全部能力,Tiny模型也无法取代所有大型模型。但从相关评测看,Ling-3.0-tiny已经具备进入代码辅助、知识工作流、工具调用和本地Agent应用的能力基础,其定位也超出了单纯追求“设备装得下”的小尺寸模型。

Agent评分超31B大模型
输出速度超160 tokens/s
Ling-3.0-tiny较突出的方向是真实任务与Agent执行。
其Artificial Analysis Agentic Index得分为16,高于Gemma-4-31B;其中,GDPval-AA v2取得772 Elo,τ³-Banking得分为20.80,体现了模型在任务理解、工具调用和流程推进方面的能力。

在百灵此次列出的对比模型中,Ling-3.0-tiny在IMO-AnswerBench和非幻觉率指标上取得领先成绩,在数学、科学推理、代码Agent、指令遵循和长上下文等任务上的表现也较为均衡。

在综合智能指数达到25分的同时,Ling-3.0-tiny输出速度超过160 tokens/s,输出500个Token的端到端用时约18秒,这一时间已经包含模型思考过程。

较小的激活规模由此转化为更短的任务等待时间,也有助于提升Agent连续执行任务时的响应效率。

站在DeepSeek、Kimi肩膀上创新架构
降低本地部署门槛
Ling-3.0-tiny延续Ling-3.0系列的原生混合线性注意力技术路线,并针对轻量化和低门槛部署进一步优化。其总参数量被控制在7.9B,每个Token的激活参数量为1.3B。
模型采用3:1 KDA-MLA架构,即每4层包含3层KDA和1层MLA,以提高长上下文处理效率。
在MoE部分,Ling-3.0-tiny设置了128个稀疏专家。每个Token会激活8个路由专家和1个共享专家,以较小的激活参数量承载更完整的模型能力。
该模型还采用原生混合推理机制,让常规任务的快速响应和复杂任务的多步思考由同一模型完成。Multi-Token Prediction训练目标则为更高效的Token预测及后续推理加速提供基础。
这些架构设计主要指向三项实际价值:减少推理所需的计算资源,降低本地部署和二次开发门槛,并让轻量模型具备接入真实Agent工作流的能力。

从DGX Spark到MacBook
三个精度版本覆盖不同设备
Ling-3.0-tiny此次同步开源BF16、FP8和INT4三个版本,开发者可以按照硬件条件、性能要求和成本选择部署方案。
其中,BF16版本适用于重视完整精度的研究评测和生产应用;FP8版本在模型效果、运行速度和资源占用之间寻求平衡;INT4版本进一步压低资源需求,面向算力和内存相对有限的本地环境。
三个版本的推出,使模型能够覆盖从专业级本地AI工作站到个人电脑的不同设备。开发者可以将其接入本地知识库、代码助手、UI自动化、企业任务智能体等工作流,并将模型和业务数据保留在本地环境中。
1、DGX Spark:单机可支撑小规模本地服务
Ling-3.0-tiny可在单台NVIDIA DGX Spark上运行FP8推理,模型权重文件约为7.85GB。
在2K输入测试中,单请求稳态解码速度约为100至105 tokens/s;两路请求并发时,聚合解码吞吐约为161 tokens/s。
按照上述测试结果,开发者和中小团队无需搭建大规模算力集群,仅使用一台DGX Spark便可搭建独立运行的本地模型服务,为小规模用户提供推理能力。潜在应用包括企业内部知识助手、研发团队代码助手和面向特定业务流程的任务智能体。
百灵还在DGX Spark上部署Ling-3.0-tiny,并用其驱动移动设备,演示模型理解任务、调用工具、执行自动化操作并完成验证的过程。该Demo面向开发测试中的批量试跑和回归验证场景,验证了本地模型在运行成本、数据可控性和执行可靠性方面的应用潜力。

2、MacBook:首Token响应低于100毫秒
目前,Ling-3.0-tiny已完成面向MacBook(Apple Silicon)的本地运行适配,BF16和FP8版本均可运行。
在MacBook上,该模型可以用于代码辅助、文档处理、本地知识问答和工作流自动化。由于模型与数据均留在本地,用户可以减少对云端模型服务的依赖,并在处理隐私敏感信息时拥有更可控的数据边界。
其中,FP8版本进一步降低了本地运行所需资源,并将持续生成速度提高约30%,以改善多轮交互和Agent运行体验。
正如前文提到,为验证本地高频交互能力,百灵在一台配备36GB内存的MacBook Pro上复刻了Infinite Wiki(无限百科)的核心体验。测试表明,Ling-3.0-tiny已经能够在Mac上承担高频本地交互任务,并以接近原生应用的响应速度充当本地知识引擎。
3、Mac mini:变身常驻式本地智能节点
Ling-3.0-tiny面向Apple Silicon的部署方案也可以延伸至Mac mini。
相比更侧重移动办公的MacBook,Mac mini更适合作为低功耗、常驻式的本地智能节点,为个人或小型团队持续提供知识库检索、文档分析、自动化任务和本地模型API服务。
在百灵展示的Demo中,Ling-3.0-tiny被部署在Mac mini上,用于划词翻译、语法纠错和文本改写。相关任务无需将数据上传云端,可以离线运行并提供低延迟响应,适用于个人及企业的本地阅读与写作场景。

至此,Ling-3.0-tiny已经完成从DGX Spark、MacBook到Mac mini的适配验证。不同精度版本与设备形态共同扩大了这款模型的部署范围,也让中小团队能够根据算力、数据边界和业务需求选择更合适的本地运行方式。
结语:下一步将补强事实准确性
和长程Agent稳定性
百灵称,接下来其将继续增强Ling-3.0-tiny的长尾知识覆盖和事实准确性,提高复杂工具调用及长程Agent任务的稳定性,并优化代码、科学推理和长上下文能力。
团队还计划改善模型推理能力、响应时间和任务成本之间的平衡,完善FP8和INT4版本的硬件适配、推理框架支持与部署文档,并与硬件厂商、高校及开发者社区共同建设轻量模型生态。
文章来自于微信公众号 “智东西”,作者 “智东西”
【开源免费】Browser-use 是一个用户AI代理直接可以控制浏览器的工具。它能够让AI 自动执行浏览器中的各种任务,如比较价格、添加购物车、回复各种社交媒体等。
项目地址:https://github.com/browser-use/browser-use
【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!
项目地址:https://github.com/coze-dev/coze-studio
【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。
项目地址:https://github.com/n8n-io/n8n
在线使用:https://n8n.io/(付费)
【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。
项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file
【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。
项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file
在线使用:https://vectorvein.ai/(付费)
【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。
项目地址:https://github.com/Significant-Gravitas/AutoGPT
【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。
项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md
【开源免费】FASTGPT是基于LLM的知识库开源项目,提供开箱即用的数据处理、模型调用等能力。整体功能和“Dify”“RAGFlow”项目类似。很多接入微信,飞书的AI项目都基于该项目二次开发。
项目地址:https://github.com/labring/FastGPT