核心信息
研究者用强化学习训练了一个40亿参数的视觉语言模型来玩GeoGuesser,并将环境、数据集、训练方法、评估和代码全部开源。该模型可在单个A100上运行,在评估中超越多个更大规模的模型。
要点
- 完全开源: 环境、数据集、训练配置、评估和代码均已发布,可端到端复现。
- 高效低成本: 仅需一张A100 GPU即可运行。
- 表现强劲: 在评估中超越GPT 5.4 mini、Claude Haiku与Qwen 3.5 122B,接近Sonnet的水平。
研究者用强化学习训练了一个40亿参数的视觉语言模型来玩GeoGuesser,并将环境、数据集、训练方法、评估和代码全部开源。该模型可在单个A100上运行,在评估中超越多个更大规模的模型。
RT @adithya_s_k: we RL trained a 4B VLM to play GeoGuesser > environment, dataset, training recipe, evals, and code are all open-source. > runs on a single A100 > beat gpt 5.4 mini, haiku, qwen 3.5 122B and came close to sonnet on evals https://t.co/QqGyompcW1
You can literally RL a 4B VLM to ace GeoGuesser 🌍 > Open-source code, RL environment, dataset, training setup, evals, and everything you need to reproduce it end-to-end > dropping soon!! https://t.co/bfzNjRad8W