字节的 Seed 悄咪咪整了个会自己进化的模型:一次接入,永远最新!

首页 AI资讯 AI技术研报 AI监管政策 AI产品测评 AI商业项目 arena全球大模型排行榜 AI产品热榜 AI 源力市场 AI新闻日报

字节的 Seed 悄咪咪整了个会自己进化的模型:一次接入,永远最新!
AI资讯 2026-09-12 10:03
+8266 阅读

字节的 Seed 悄咪咪整了个会自己进化的模型:一次接入,永远最新!


不知道你有没有发现一件事。


2026 年 8 月,国产模型在 Benchmark 上跟海外几乎拉平了,Work Agent 这条赛道也形成了字节、阿里、腾讯三国杀的局势。


到了这个阶段,一个趋势开始浮出水面:Agent 决胜的胜负手,早已不是效果。


一流的 Harness,配上性价比足够高的模型,足以完成 95% 的工作任务:模型本身的分数差异,在真实工作场景里越来越难被感知。


这意味着什么?


我们不需要再为每次模型发布凌晨蹲自媒体的一手评测稿,看奥特曼瘫坐原子弹。你真正需要管理的不是模型版本号,而是你的睡眠时间和注意力。


这段时间,我一直在用 Seed-Evolving 作为 Codex 里的主力模型,这也是为什么我们以前在测评中多次提到这个模型的原因:它最大的特点就是模型底座日渐变强。接入了它很简单,并且它会持续进化,相当于订阅了一个会自动进化的大模型。


它让每天不再焦虑自己用的是不是最强的模型的不确定性,而是知道它一定会变强,多一点确定性的快乐和偶然的欢喜。


Seed-Evolving 更新了什么?


先简单介绍下这模型:Seed-Evolving 是字节 Seed 团队面向 Coding 与 Agent 场景持续迭代的模型版本。


注意这个持续迭代,它跟我们熟悉的模型发布逻辑有本质区别。


传统的做法是什么?攒一个大版本,测半天,挑个好日子发出来,然后开始攒下一个。中间用户拿到手的就是一个「发布日之后慢慢过时」的版本。


Seed-Evolving 的做法完全不同:它保持周级迭代节奏,用统一的 Model ID 接入,新版本自动生效。


你不需要切换 Model ID,不需要迁移 Endpoint,不需要调整调用方式。今天调用它跑出来的结果,跟上周可能效果又会好一些,因为模型本身在持续变强。


这次是 Seed-Evolving 的第五版更新,有几个核心能力的关键更新:


通用 Agent 能力目前国内领先,处于全球第一梯队,性价比优势显著。新版在长程任务的端到端完成力上全面增强,跨应用业务编排、多工具连续调用、科学数据分析,以及企业级搜索调研与幻觉控制都有明显进步。


Coding Agent 方面,在陌生代码仓中持续探索、跨文件修改并通过验证的能力大幅提升。人工众测中,长链路 Coding 任务的"功能闭环"被评为最完整,无核心功能缺失。


还有一个让我特别兴奋的点:VLM 视觉理解能力又升级了。


多模态理解一直是豆包 Seed 模型的优势能力,处于全球第一梯队,这次在开放式视觉推理、抽象规则归纳、三维结构理解和「看图写代码」等复杂视觉任务上都有突破性进展。


下面进入实测环节。


Seed-Evolving 一手实测


我想测的第一件事,是 Seed-Evolving 在 Coding 长程交付上的表现。


具体任务是这样的:结合一个开源的浏览器自动化项目,让 Seed-Evolving 帮我从零搭建一个能自动控制浏览器盯股票盘的 Agent。


这个任务的难度在于,它不是简单的做个 demo,而是需要理解开源项目的架构、搞清楚依赖关系、完成多文件的代码编写、调试、联调,最后跑通整个流程。


我把需求描述丢给 Evolving,然后开始观察它的执行过程。


字节的 Seed 悄咪咪整了个会自己进化的模型:一次接入,永远最新!


它先花了一段时间阅读开源项目的文档和核心代码,理清了项目结构。然后开始规划任务拆解,从环境配置到核心逻辑编写,再到异常处理和测试用例,整个规划链路非常清晰。


然后半个小时后,整个 Agent 全部开发完成:


字节的 Seed 悄咪咪整了个会自己进化的模型:一次接入,永远最新!


界面已经可以显示盯盘内容了:


字节的 Seed 悄咪咪整了个会自己进化的模型:一次接入,永远最新!


接着,我又给他加了一个需求:根据当天新闻增加智能分析涨跌,VLM 盯图、自定义打开浏览器三个功能。


等待 20 分钟,最终,一个可以自动打开浏览器、导航到指定页面、执行预设操作序列的 Agent 跑了起来。


字节的 Seed 悄咪咪整了个会自己进化的模型:一次接入,永远最新!


它不仅可以盯盘,还能智能结合社会热点分析股票的涨跌原因:Deepseek-V4.1-flash 后,智谱股票大跌(相信 GLM5.5 发布后,马上能涨回来),Agent 可以客观理性的分析问题。


字节的 Seed 悄咪咪整了个会自己进化的模型:一次接入,永远最新!


这个 Case 让我确认了一件事:Seed-Evolving 在长程 Coding 任务上的交付完整度,确实到了一个新的水平。


它可以帮我把一个工程项目从头到尾搭起来,并且实现非常好的指令遵循。


第二个 Case,我想测长程工作能力和 VLM。


基于刚刚完成的 Agent,我让 Seed-Evolving 定时截取股票行情界面,识别关键数据,然后生成结构化的分析摘要:


这个任务的难点在于,股票界面是纯视觉信息,没有 API 可以直接拉数据,模型必须看懂屏幕上的数字、图表和颜色标记。


行情图上面同时显示了 K 线图、成交量柱状图、MACD 指标:


字节的 Seed 悄咪咪整了个会自己进化的模型:一次接入,永远最新!


Seed-Evolving 的识别结果让我有点吃惊:它不仅准确读出了个股价格、涨跌幅、成交量这些基础数据,还正确识别了 K 线形态和技术指标的数值。


更有意思的是,它还能在肉眼看着复杂的图里精确的标注日期:时间轴可见2026-03-19、2026-06-17、2026-09-10。


字节的 Seed 悄咪咪整了个会自己进化的模型:一次接入,永远最新!


我又连续跑了几天,让它每隔一小时截一次屏做识别:Seed-Evolving 在长程执行中表现得很稳定,每次生成的摘要格式一致,数据准确率也保持在很高的水平。


这个 Case 让我真切感受到了 VLM 在实际工作场景中的价值:很多时候,你想自动化的那些任务,数据就摆在屏幕上,但就是没有一个干净的 API 给你调。


VLM 能力强的模型,等于帮你打开了一扇门。


第三个 Case 是我觉得最炸的一个。


我拿了一张云谷中心的建筑设计图,想看看 Seed-Evolving 能不能帮我在 Blender 里还原出来。


这个任务对 VLM 的要求极高:模型需要从一张 2D 设计图中理解三维空间关系、建筑比例、材质特征,然后生成可执行的 Blender 建模代码。


我们的部分设计图大概长这样:


字节的 Seed 悄咪咪整了个会自己进化的模型:一次接入,永远最新!


我把设计图传给 Evolving,附上一句“参考这个pdf,使用 blender 中还原建筑的基本形态和空间关系”。


字节的 Seed 悄咪咪整了个会自己进化的模型:一次接入,永远最新!


它先输出了一段对设计图的详细分析:建筑的整体轮廓、楼层数、主要立面特征、入口位置、周围景观的大致布局。这个分析的准确度很高,说明它确实看懂了这张图。


字节的 Seed 悄咪咪整了个会自己进化的模型:一次接入,永远最新!


然后它开始生成 Blender Python 脚本:代码量不小,包括了基础体块的创建、楼层的叠加、立面细节的处理,甚至考虑到了周围地形的高差关系。


字节的 Seed 悄咪咪整了个会自己进化的模型:一次接入,永远最新!


等了 28 分钟,我在 Blender 里打开,一个建筑的基本形态就出现了。


字节的 Seed 悄咪咪整了个会自己进化的模型:一次接入,永远最新!


接着,我让它开始进行家装上色,然后通过对话修改了下,最终的效果就做出来了:


字节的 Seed 悄咪咪整了个会自己进化的模型:一次接入,永远最新!


为了方便演示,我导出到了 Three.js 录制了一个动态的视频:


字节的 Seed 悄咪咪整了个会自己进化的模型:一次接入,永远最新!


如果对比三个月前的 Deepseek-V4-pro 通过 Agent 做的 3D 图,效果提升的十分明显。


字节的 Seed 悄咪咪整了个会自己进化的模型:一次接入,永远最新!


这个 Case 验证的是 Seed-Evolving 在 VLM 和 Coding 能力交叉地带的表现:它需要同时做到「看懂复杂视觉信息」和「生成正确的参数化建模代码」,这两个能力缺一不可。


在官方的 BenchCAD 评测中,Seed-Evolving 新版在三维结构理解和视觉到代码的能力上有显著提升。


我在实测中,也确实感受到了 Seed-Evolving 在 3D 领域里的显著进步。


Seed-Evolving:一次接入,持续进化


整体来说,Seed-Evolving 的这次能力更新让我感觉很惊喜。


先是 Coding 和 Agent 方向的提升:Seed-Evolving 的长程任务的完成度确实上了一个台阶:它的指令遵循、多步规划、跨文件修改这些环节,体感上比之前顺滑了不少。


一个更大的变化是,Seed-Evolving 在完成复杂任务上开始更加主动,它会根据我的需求自己规划方案和设计,需要用户确认、返工和修改的内容越来越少。


再说它的 VLM 能力:这是我觉得这次更新里一个非常有价值的部分。


Seed-Evolving 视觉理解能力强了之后,在 Coding 和 Agent 场景里能解锁的东西比想象中多很多:看设计稿写代码、看屏幕截图提取数据、看建筑图生成 3D 建模脚本、看行情图做结构化分析。


以前用国产模型做这些视觉内容,出来的效果都很勉强,现在 Seed-Evolving 往前进了一个大步:体感上到了「可以用」,甚至「好用」的程度。


值得一提的是,模型的 VLM 能力也变得越来越重要:


最近因为 GPT-6 的发布,Blender 火了。从传播层面看,视觉内容天然比文字更容易被人类感知。但回到真实产业应用,VLM 解决的是一个更核心的问题:让 AI 能够使用浏览器和软件。


过去,模型只能处理有结构化接口的那一小块世界(大部分软件其实并没有 API)。现在,它可以进入没有 API 的长尾蓝海:Design-to-Code、GUI 自动化、文档理解、端到端软件测试,这些高价值场景正在被逐一打开。


最后,当然就是 Seed-Evolving 的「持续进化」。


Seed-Evolving 用的是统一的 Model ID,接入一次之后不用管版本切换,新版本自动生效。


它真的可以帮我们屏蔽模型圈的浮躁:你不再需要盯着模型的版本号,也不需要看发布的 benchmark 决定要不要切模型,你只需要相信,它就是在持续迭代、快速变强,就可以把注意力放在提升自己对 Agent 的使用能力上。


从这个层面看,订阅 Evolving,就等于订阅了一个你不用操心、价格不变、性能持续变强的大模型服务。


当模型效果逐渐拉平,用户期待的不再是某个模型的惊艳发布,而是可以自动订阅厂商里“当前最强版本”的模型:一次接入,持续进化。


更进一步看,当一个模型同时具备强 Coding/Agent 能力、强 VLM 能力,并且还在持续进化,它带来的就不只是单点能力突破:把强大的 AI 能力深度集成到现实生活里,给我们带来真正的生产力解放。


大家可以在火山 Agent Plan 里调用豆包搜索和 Seed-Evolving 模型,单月套餐限时只要 9.9 元,我已入手,欢迎体验 👉


https://ark.volcengine.com/region:cn-beijing/model/detail?_vtm_=a441938.b75322.0_0.0_0.0.140_7680087491668166163&name=doubao-seed-evolving


字节的 Seed 悄咪咪整了个会自己进化的模型:一次接入,永远最新!



文章来自于微信公众号 “特工宇宙”,作者 “特工宇宙”

1
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

添加客服微信openai178,进AITNT官方交流群