- ✓
10×私人储存容量
- ✓
2×公共储存容量
- ✓
20×包含推理制作人员
Jamba by AI21 Labs
运行800页上下文、速度提升2.5倍的开源大语言模型
Jamba by AI21 Labs 是什么?
Jamba 是 AI21 Labs 推出的开源大语言模型,采用创新的 Mamba-Transformer 混合架构,能够在单张 80GB GPU 上快速处理 256K tokens 的长上下文,速度达到传统 LLM 的 2.5 倍,完全开源且经过基准测试验证。
产品详细介绍
运行800页上下文、速度提升2.5倍的开源大语言模型
Jamba 是 AI21 Labs 推出的开源大语言模型,采用创新的 Mamba-Transformer 混合架构,能够在单张 80GB GPU 上快速处理 256K tokens 的长上下文,速度达到传统 LLM 的 2.5 倍,完全开源且经过基准测试验证。
定价方案
有免费方案- ✓
SSO支持(SAML和OIDC)
- ✓
带存储区域的数据位置控制
- ✓
详细的行动审查及审计日志
- ✓
团队计划的所有好处
- ✓
最高存储、带宽和API速率限制
- ✓
采用SCIM配置的自动用户管理
创始人评论
嘿,PH 👋
我已经用大型语言模型构建有一段时间了,但有一个问题在生产环境中总是以不同的方式出现:上下文会损害性能。
你需要分析一份200页的合同。把一周的日志输入你的流程。用RAG覆盖整个知识库,避免分块噩梦。几乎所有模型要么速度极慢,要么超出预算,要么在上下文窗口边缘默默地开始幻觉。
这正是 Jamba(由 AI21 Labs 开发)解决的问题,它以别人做不到的方式做到了。
是什么让Jamba真正与众不同:
Jamba 运行在混合 Mamba-Transformer 架构上,而非纯粹的 Transformer。这有什么关系?变形金刚很棒,但随着上下文增长,成本会变成二方。Mamba速度快且内存高效,但历史上质量较弱。AI21的Jamba工程师找到了如何将两者与专家混合层(MoE)交织,实现两者的优点。
结果如下:
✅ 256K令牌上下文窗口:开放权重模型中最长的,也是唯一一个在RULER基准测试中实际验证过的窗口(而非仅仅宣称的)
✅ 与同等规模模型相比,在长上下文中推断速度快了2.5倍
✅ 能装在一块80GB的显卡上:对于运行企业工作负载来说,这可不是件容易的事
✅ 完全开源:直接下载并自架,无厂商锁定
✅ 可部署在您的基础设施、云合作伙伴或私有环境中
目前的模特家族:
最佳车型:
Jamba2 3B:设备端应用,代理式工作流程
Jamba2 Mini:核心企业任务,效率优先
Jamba 推理 3B:低延迟企业推理
以下是一些真正能发挥作用的应用场景:
🏦 财务:提供完整的年报、SEC文件、合同无分块
🏥 医疗保健:处理冗长的患者记录,提供有根据、准确的答案
🛡️ 国防/政府:主权AI,完全空缺部署选项
🛠️ 开发者:构建真正能在上下文窗口边缘工作的RAG管道
我为什么要发这篇帖子:
我对Jamba感到非常兴奋,因为AI21所做的建筑赌注既不明显又被低估了。大家还在竞相调试变形金刚。与此同时,AI21发布了一个398B参数模型(94B活跃),运行Mamba + Attention图层,比例为1:7,MoE路由并在ICLR发布相关论文。
这不是“GPT的包装”。这是基础模型架构研究,作为产品发布,您可以今天下载。
如果你是工程师、研究人员或企业建设者,遇到上下文长度、吞吐量或成本问题,Jamba 值得你认真关注。
创始团队
官网信息
HF Hub是探索、实验、协作和构建机器学习技术的核心场所