Qwen3.8-27B 登顶全球开源榜第一,曾经的「源神」又回来了!

首页 AI资讯 AI技术研报 AI监管政策 AI产品测评 AI商业项目 arena全球大模型排行榜 AI产品热榜 AI 源力市场 AI新闻日报

Qwen3.8-27B 登顶全球开源榜第一,曾经的「源神」又回来了!
AI资讯 2026-08-20 09:02
+5267 阅读

Qwen3.8-27B开始和顶级闭源模型正面叫板,过度思考是最大问题。


01

一个 27B 的模型,

为什么突然让全球 AI 社区兴奋?


如果只看参数,Qwen3.8-27B 并不像一个会制造太大声量的模型。27B参数,在今天动辄数千亿甚至万亿参数的旗舰模型面前,甚至显得有些“小”。但2026年8月14日,阿里千问正式开源Qwen3.8-27B之后,海外AI社区的反应却异常热烈。


Qwen3.8-27B 登顶全球开源榜第一,曾经的「源神」又回来了!


原因恰恰就在这个“小”字上。


Qwen3.8-27B 登顶全球开源榜第一,曾经的「源神」又回来了!


在Qwen官方公布的成绩里,Qwen3.8-27B 已经开始在部分 Coding 和 Agent 测试中,与 Claude Opus 4.6 Max 这样的前沿闭源模型放在同一张表格里比较。与此同时,4bit 量化后约 17.1GB,一张 RTX 4090 或 3090 就能完整装下,进入了个人设备能够尝试本地运行的范围。


Qwen3.8-27B 登顶全球开源榜第一,曾经的「源神」又回来了!


这形成了一种过去并不常见的反差:一边是消费级硬件能够承受的模型尺寸,另一边却开始出现过去只有云端旗舰模型才会被期待的Coding和Agent能力。


独立开发者Simon Willison直接评价 Qwen3.8-27B “excellent”,Reddit社区中 LocalLLaMA上有人把它称作 “游戏规则改变者”;另一些实际用它完成 Coding 任务的用户,则开始用“接近Opus”来描述自己的体验。围绕它的讨论,也很快从传统的“这个模型Benchmark多少分”,变成了“我的3090能不能跑”“24GB显存用什么量化”“能不能直接接进Coding Agent”。


Qwen3.8-27B 登顶全球开源榜第一,曾经的「源神」又回来了!


过去谈到本地部署模型,默认往往意味着一种交换:用户获得隐私、可控和更低的使用成本,同时接受能力上的明显妥协。真正复杂的Coding、工具调用和长程Agent任务,仍然主要属于Claude、GPT这类运行在云端的前沿闭源模型。Qwen3.8-27B正在挑战的,正是这个默认前提。


02

Qwen3.8-27B

开始达到旗舰模型的上限


Qwen3.8-27B 最值得关注的是,它用 27B 的尺寸同时承载了 Coding、Agent、长上下文、多模态四项能力


27B 并不算一个极小的模型,但它已经进入个人硬件可以真正部署的范围。经过 4bit 量化后,部分版本的模型权重只有 17GB 左右,一张 24GB 显存的 RTX 3090 或 4090 就有机会把完整权重装进显存。相比动辄数百亿、数千亿参数,必须依赖多卡服务器运行的旗舰模型,这已经是完全不同的部署门槛。


Qwen3.8-27B 对长上下文的设计也明显服务于这个目标。它共有 64 层,其中 48 层采用 Gated DeltaNet,16 层保留完整 Attention。传统全注意力需要随着上下文不断增长 KV Cache,而 DeltaNet 使用固定规模的循环状态,因此可以降低长文本带来的显存压力。模型原生支持 262K 上下文,并可以进一步扩展到 100 万 Token。


但这些只是前提。真正让它和 Opus 4.6 Max 放在同一张表格里的,是 Agent 和 Coding。


Qwen3.8-27B 登顶全球开源榜第一,曾经的「源神」又回来了!


在 Qwen 官方公布的数据中,Qwen3.8-27B 在 SWE-bench Pro (真实GitHub issue修复)上达到 61.7,官方列出的 Claude Opus 4.6 Max 成绩为 53.4;OSWorld-Verified (电脑操作)为 84.3 对 72.7,AndroidWorld (手机操作)为 81.9 对 62.0,CoWorkBench(长周期办公任务) 为 70.7 对 68.2。LiveCodeBench v6 (代码生成)上,Qwen3.8-27B 也达到 90.3。


官方榜单之外,一批社区横向测试也在提供更直观的参照。


有开发者用完全相同的 Prompt,让 Qwen3.8-27B 和上一代 Qwen3.6-27B 分别生成同一个 voxel pagoda。在同一台 DGX Spark、相同量化设置下,3.8 在场景完整度和视觉效果上都明显更成熟。


Qwen3.8-27B 登顶全球开源榜第一,曾经的「源神」又回来了!


再往外看,有用户把它和同体量的 Glimmer-30B 放在一起测试 Three.js 场景。此前 Glimmer-30B 已经是 30B 左右本地模型里表现相当强的一档,但换到 Qwen3.8-27B 后,用户最终仍然把优势判给了 Qwen。


Qwen3.8-27B 登顶全球开源榜第一,曾经的「源神」又回来了!


更有意思的是,社区已经开始直接拿它和 Claude Opus 做同 Prompt 的前端生成对比。单个 Demo 显然不能证明 Qwen 已经达到 Opus 的整体水平,但这种比较本身已经说明了问题:过去一个本地 27B 模型和顶级闭源模型之间,往往根本没有正面对比的必要;现在至少在部分 Coding 和前端任务上,两者已经可以放在同一个画面里比较。


Qwen3.8-27B 登顶全球开源榜第一,曾经的「源神」又回来了!


把这些结果放在一起,Qwen3.8-27B 目前的位置大致已经可以看清:和上一代 27B 相比,它的能力上限明显往前走了一截;放到 30B 左右的本地开源模型里,它已经处在第一梯队;而在部分 Coding 和 Agent 任务上,它甚至开始摸到前沿闭源模型的能力区间。


如果 Qwen3.8-27B 只能通过 API 调用,它最多只是又一个强模型。但经过量化后,它已经能进入个人工作站和企业私有环境,代码、文档和 Agent 工作流都可以留在本地。一个个人硬件能够承受的 27B 模型,开始进入过去主要属于前沿闭源模型的 Coding 和 Agent 能力区间。


过去本地部署往往意味着牺牲能力,Qwen3.8-27B 正在缩小这种能力折扣。


03

过度思考,是它最大的问题


在海外社区,有人已经把 Qwen3.8-27B 称作“Opus at Home”。但榜单之外,围绕它最集中的争议也很明确:模型能力强,但是推理时间太长;而Benchmark上的领先,也还没有完全转化成真实Agent体验。


为了一个答案,它能先想21分钟


问题首先出在 reasoning_effort上。Qwen3.8-27B 提供 xhigh、medium、low、none 四档推理强度,默认使用最高的 xhigh。对于复杂Coding和长程Agent,这可以换来更充分的推理;但放到消费级硬件上,代价也非常直接——慢,而且大量消耗Token。


Qwen3.8-27B 登顶全球开源榜第一,曾经的「源神」又回来了!


Django 联合开发者 Simon Willison 做过一个很典型的测试:让模型生成一张“骑自行车的鹈鹕”SVG,Qwen3.8-27B 花了 21分钟,产生 22,276 个推理Token,最终输出只有3,223 Token;关闭深度思考后,同一个任务缩短到137秒。社区里类似反馈并不少见。有人让它写一个简单游戏,模型先思考了半小时;也有人把它接进Coding Agent,一次任务的思维链跑掉数万Token。


Qwen3.8-27B 登顶全球开源榜第一,曾经的「源神」又回来了!


这也暴露了Qwen3.8-27B目前最明显的矛盾:它的能力上限很高,但默认设置并不一定适合本地用户。


对于云端旗舰模型,长时间推理更多表现为价格和等待时间;到了3090、4090这样的个人硬件上,推理强度会直接变成速度、显存和使用体验。一个本来以“本地可跑”为最大优势的模型,如果简单任务也需要长时间思考,这个优势就会被部分抵消。


榜单赢了,真实Agent未必赢


另一个需要降温的,是“超Opus”这个说法。


Qwen3.8-27B在SWE-bench Pro、OSWorld-Verified等测试上的确表现亮眼,但这些仍然是标准化、受控环境下的任务。真实Agent面对的变量更多:任务可能持续几个小时,需要反复调用工具、修改代码、处理异常,还要保证过程中不跑偏。


Qwen3.8-27B 登顶全球开源榜第一,曾经的「源神」又回来了!


(Qwen3.8-27B 总分 48.0%,排名第 15;该 Benchmark 共 60 项真实 Agent 任务。)


在更复杂的真实任务里,27B的优势并没有那么绝对。例如在WildClawBench的60项Agent任务中,Qwen3.8-27B虽然明显超过前代,但仍落后于一些更大的托管模型。


这也是为什么不能直接把“某几项Benchmark超过Opus”翻译成“真实使用已经可以取代Opus”。实际使用最终看的不是一张榜单,而是几个更难回答的问题:长任务能不能稳定完成,工具调用会不会出错,代码修改能不能收敛,以及为了得到这个结果,需要等待多久、消耗多少计算。


因此,现在给Qwen3.8-27B一个更准确的位置,可能不是“本地Opus”,而是:


它已经证明,27B开源模型有资格进入顶级闭源Agent的比较范围,但还没有证明自己能够全面替代它们。


04

真正的变化:

前沿 Agent 正在开始进入个人电脑


回到开头那个问题:一个27B模型,为什么能让全球社区这么兴奋?


过去几年,本地模型一直有一个默认前提:隐私、便宜、可控,但能力要妥协。 一个能在消费级硬件上运行的模型,意味着你得接受它在复杂Coding、多步推理、工具调用上的明显短板。真正要干活,还是得切回Claude或GPT。本地运行和前沿能力之间,存在一条清晰的分界线。


Qwen3.8-27B第一次让这条线变得模糊了,“本地运行”和“前沿Agent能力”正在第一次变成可以同时追求的东西。


过去开源模型的叙事是“追上闭源”。Qwen3.8-27B的叙事是“闭源模型的能力,第一次以可部署的尺寸出现在本地硬件上”。前者是追赶,后者是下放。追赶是总是暂时的,你今天追上,明天可能又被拉开;下放则是结构性的,一旦能力被压缩到消费级硬件可承受的尺寸,它就不会再缩回去了。


前沿Agent能力正在从云端下放到个人电脑,这才是Qwen3.8-27B真正值得被记住的原因。它也许不是最终的答案,但它逼出了下一个必须回答的问题:如果未来所有27B级别的模型都具备这种Agent能力,开发者的工作流、企业的部署策略、甚至个人采购GPU的逻辑,是不是都要跟着重写一遍?


文章来自于"AI科技评论",作者 "李娜"。

1
AIExcel公式

【开源免费】smart-excel-ai是一个输入你想要的Excel公式的描述,即可帮你生成对应公式的AI项目

项目地址:https://github.com/weijunext/smart-excel-ai

在线使用:https://www.smartexcel.cc/(付费)

2
AI工作流

【开源免费】字节工作流产品扣子两大核心业务:Coze Studio(扣子开发平台)和 Coze Loop(扣子罗盘)全面开源,而且采用的是 Apache 2.0 许可证,支持商用!

项目地址:https://github.com/coze-dev/coze-studio


【开源免费】n8n是一个可以自定义工作流的AI项目,它提供了200个工作节点来帮助用户实现工作流的编排。

项目地址:https://github.com/n8n-io/n8n

在线使用:https://n8n.io/(付费


【开源免费】DB-GPT是一个AI原生数据应用开发框架,它提供开发多模型管理(SMMF)、Text2SQL效果优化、RAG框架以及优化、Multi-Agents框架协作、AWEL(智能体工作流编排)等多种技术能力,让围绕数据库构建大模型应用更简单、更方便。

项目地址:https://github.com/eosphoros-ai/DB-GPT?tab=readme-ov-file



【开源免费】VectorVein是一个不需要任何编程基础,任何人都能用的AI工作流编辑工具。你可以将复杂的工作分解成多个步骤,并通过VectorVein固定并让AI依次完成。VectorVein是字节coze的平替产品。

项目地址:https://github.com/AndersonBY/vector-vein?tab=readme-ov-file

在线使用:https://vectorvein.ai/付费

3
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

4
prompt

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0

添加客服微信openai178,进AITNT官方交流群