RSIGym开源:让AI研究如何改进AI,瞄准递归自我改进
动察 Beating AI 快讯,做 AI 训练和评测工具的 Evolvent AI 开源了 RSIGym,目标是研究 AI 的递归自我改进(RSI)。简单说,就是让 AI 自己寻找系统弱点、提出修改方案、测试效果,再尝试用改进后的系统开展下一轮研究。
RSIGym 将训练、推理、评测和沙箱做成现成服务。研究 Agent 可以生成训练数据、调整微调参数、训练模型,再根据评测结果修改方案。它还能修改 Harness,也就是控制模型如何调用工具、执行任务的程序。研究者可以让 Agent 只改训练数据、只改 Harness,或者同时优化两者。平台统一管理实验预算、权限和执行日志。
团队还推出 RSI-Index,测试 AI Agent 改进另一套 AI 系统的能力。6 款研究 Agent 分别从相同的 Qwen3.5 基础模型和简单 Harness 出发,在编程、数学等 5 类任务上进行优化。Opus 5 综合排名第一。它改造后的系统在 SWE-bench Verified 的 100 题子集上,成绩从 17.67% 提高到 50.33%;数学测试 AIME 则从 31.67% 提高到 97.78%。
另一组实验只改 Harness,不动模型权重。Opus 5 根据 DeepSeek Harness 的执行日志,修复了输出截断后停止工作、提前宣布任务完成等问题。在 Qwen3.6 模型权重完全不变的情况下,Terminal-Bench 2.0 成绩从 30.34% 提高到 40.82%。
团队还尝试让 Qwen3.8-27B 改进自身,由它同时担任研究 Agent 和被改进的模型。它在 6 道测试题上找到了一套看起来有效的微调方案,但在完整的 37 道题中,成绩反而从 56.66% 略降至 56.26%。此外,每组实验只进行一次研究运行,Agent 在开发阶段也能接触评测题目。目前还没有证据表明,改进后的 AI 可以继续提升自身的研发能力,实现多轮递归自我改进。

