JetBrains开源Mellum2.1:LiveCodeBench测试超过Qwen3.5-9B
动察 Beating AI 快讯,JetBrains 发布开源编程模型 Mellum2.1。与今年 6 月推出的 Mellum2 相比,新版总参数仍为 120 亿,每次生成只激活 25 亿,但更擅长查找代码问题、修改文件并检查结果。
JetBrains 没有改动模型架构,主要靠强化学习提升能力。团队在数千种环境中运行了数百万次沙盒任务。训练时,模型在真实代码仓库中调用终端和文件编辑工具,成功通过测试便能获得奖励。
JetBrains 自测显示,SWE-bench Verified(真实软件问题修复测试)的成功率从旧版 2% 升至 47%,略低于 Qwen3.5-9B 的 50%。但在 LiveCodeBench v6 编程测试中,Mellum2.1 得分 82%,超过 Qwen 的 75.4%。JetBrains 还称,在单张 H200 上高负载运行时,新模型的输出吞吐量接近 Qwen3.5-9B 的两倍。
模型权重及 GGUF 量化版已在 Hugging Face 开放,采用 Apache 2.0 许可,可供开发者本地部署。

