AI 日报 · 10月5日:同一模型在 Mini-SWE-Agent 达 62%、Claude Code 仅 33%,编码框架对 RL 与实测表现影
研究显示同一模型权重下,Mini-SWE-Agent 达 62% 而 Claude Code 仅 33%,编码框架选择影响巨大;Requesty 披露 Claude Opus 5.5 缓存命中价仅为未命中的 1/20,Nvidia 开源 Lyra 2.0 图像转 3D 世界工具,开源 27B 安全决策模型 Security-One 发布。
-
同模型在 Mini-SWE-Agent 得 62%,Claude Code 仅 33%
研究者将 Claude Code、Codex、Hermes、Pi、opencode 等编码框架改造为 RL 环境,无需改动框架与训练代码;同一模型同一权重下,Mini-SWE-Agent 达 62%,Claude Code 仅 33%。
-
Claude Opus 5.5 缓存命中价为未命中的 1/20
Requesty 指出 Claude Opus 5.5 缓存命中的输入 token 单价为每百万 $0.20,未命中为每百万 $4.00,相差 20 倍;由于 agent 每轮都会重发完整上下文,命中与否直接决定账单。
-
开源权重 27B 安全决策模型 Security-One 发布
团队发布开源权重 27B 模型 Security-One,可读取文档、工具调用或代码改动并返回针对自定义答案的概率,由调用方代码决定放行、拦截或送审。
-
英伟达开源 Lyra 2.0 图像转 3D 世界工具
英伟达发布 Lyra 2.0,可将任意图像转为可行走、可环顾的 3D 世界,模型托管在 Hugging Face、UI 代码开源在 GitHub,还能在场景中放入机器人做仿真。
-
Hugging Face 针对多工具链 RL 泛化问题发文
Hugging Face 发布关于多工具链强化学习的指南,指出同一个开源权重模型换到另一套接口后会出现准确率下降或工具调用失效,原因是只在单一工具链内训练会过拟合该链路的工具命名约定。
-
Hugging Face 新增 RL 环境统一托管
Hugging Face 宣布 RL 环境现已入驻其 Hub,用户可在同一处发现 OpenEnv、Verifiers、Harbor、NeMo Gym 等框架的环境,取代此前分散的注册表。
-
Ling 3.1 Flash 上线 Requesty 免费使用
Requesty 宣布 AntLing 的 Ling 3.1 Flash 模型(由 Novita Labs 托管)现已在其 AI 网关上免费提供。
-
Cline 因滥用暂停 DeepSeek 免费促销
Cline 因出现异常高的滥用行为,暂时暂停了 DeepSeek-V4.1-Flash 免费促销,并表示正在调查和缓解。
-
Qwen3.8-Flash-Next NVFP4 量化检查点发布并附基准
Red Hat AI 在 Hugging Face 发布 Qwen3.8-Flash-Next 的 NVFP4 检查点,MoE 专家层量化为 FP4、其余层保留 BF16,可直接用于 vLLM,并与其他主流检查点做了基准对比,支持文本、图像与视频输入。
-
Command Code GOAT 套餐含 60 美元额度
Command Code 的 10 美元/月 GOAT 套餐包含 60 美元用量额度,可搭配 DeepSeek V4.1 Flash、DeepSeek V4.1 Flash Fast、GLM 5.3 Flash 和 Kimi K3 使用,号称数十亿 tokens。