AI工具导航

Jamba by AI21 Labs

运行800页上下文、速度提升2.5倍的开源大语言模型

Jamba by AI21 Labs 是什么?

Jamba 是 AI21 Labs 推出的开源大语言模型,采用创新的 Mamba-Transformer 混合架构,能够在单张 80GB GPU 上快速处理 256K tokens 的长上下文,速度达到传统 LLM 的 2.5 倍,完全开源且经过基准测试验证。

产品详细介绍

运行800页上下文、速度提升2.5倍的开源大语言模型

Jamba 是 AI21 Labs 推出的开源大语言模型,采用创新的 Mamba-Transformer 混合架构,能够在单张 80GB GPU 上快速处理 256K tokens 的长上下文,速度达到传统 LLM 的 2.5 倍,完全开源且经过基准测试验证。

定价方案

有免费方案
Subscribe for/custom
PRO账户
  • 10×私人储存容量

  • 2×公共储存容量

  • 20×包含推理制作人员

Subscribe for/custom
团队
  • SSO支持(SAML和OIDC)

  • 带存储区域的数据位置控制

  • 详细的行动审查及审计日志

Starting at custom/custom
企业号
  • 团队计划的所有好处

  • 最高存储、带宽和API速率限制

  • 采用SCIM配置的自动用户管理

查看官网价格

创始人评论

Ori Goshen
Ori Goshen创始人

嘿,PH 👋

我已经用大型语言模型构建有一段时间了,但有一个问题在生产环境中总是以不同的方式出现:上下文会损害性能。

你需要分析一份200页的合同。把一周的日志输入你的流程。用RAG覆盖整个知识库,避免分块噩梦。几乎所有模型要么速度极慢,要么超出预算,要么在上下文窗口边缘默默地开始幻觉。

这正是 Jamba(由 AI21 Labs 开发)解决的问题,它以别人做不到的方式做到了。

是什么让Jamba真正与众不同:

Jamba 运行在混合 Mamba-Transformer 架构上,而非纯粹的 Transformer。这有什么关系?变形金刚很棒,但随着上下文增长,成本会变成二方。Mamba速度快且内存高效,但历史上质量较弱。AI21的Jamba工程师找到了如何将两者与专家混合层(MoE)交织,实现两者的优点。

结果如下:

✅ 256K令牌上下文窗口:开放权重模型中最长的,也是唯一一个在RULER基准测试中实际验证过的窗口(而非仅仅宣称的)

✅ 与同等规模模型相比,在长上下文中推断速度快了2.5倍

✅ 能装在一块80GB的显卡上:对于运行企业工作负载来说,这可不是件容易的事

✅ 完全开源:直接下载并自架,无厂商锁定

✅ 可部署在您的基础设施、云合作伙伴或私有环境中

目前的模特家族:

最佳车型:

Jamba2 3B:设备端应用,代理式工作流程

Jamba2 Mini:核心企业任务,效率优先

Jamba 推理 3B:低延迟企业推理

以下是一些真正能发挥作用的应用场景:

🏦 财务:提供完整的年报、SEC文件、合同无分块

🏥 医疗保健:处理冗长的患者记录,提供有根据、准确的答案

🛡️ 国防/政府:主权AI,完全空缺部署选项

🛠️ 开发者:构建真正能在上下文窗口边缘工作的RAG管道

我为什么要发这篇帖子:

我对Jamba感到非常兴奋,因为AI21所做的建筑赌注既不明显又被低估了。大家还在竞相调试变形金刚。与此同时,AI21发布了一个398B参数模型(94B活跃),运行Mamba + Attention图层,比例为1:7,MoE路由并在ICLR发布相关论文。

这不是“GPT的包装”。这是基础模型架构研究,作为产品发布,您可以今天下载。

如果你是工程师、研究人员或企业建设者,遇到上下文长度、吞吐量或成本问题,Jamba 值得你认真关注。

创始团队

Ori Goshen
Ori Goshen创始团队

官网信息

官网https://huggingface.co/ai21labs/collections?ref=producthunt
公司使命

HF Hub是探索、实验、协作和构建机器学习技术的核心场所