核心信息
一份完整的开源报告现已发布,公开了 RL 环境、人工评分评估池、三次训练运行以及项目期间生成的全部画作。
要点
- 训练方案使用 TRL 与开放环境,并公开了完整实验过程。
- 开放内容涵盖代码、模型、数据集、RL 环境和全部生成画作。
- 人工评分池为各次运行提供了人类评估数据。
- 后续还将发布包含完整开放工件的博客文章。
一份完整的开源报告现已发布,公开了 RL 环境、人工评分评估池、三次训练运行以及项目期间生成的全部画作。
RT @SergioPaniego: full write-up is out with everything open > the env, the hand-rated pool, the 3 runs and every painting they made https://t.co/dZmxVruqYx
trained my own with trl + openenv blog with open artifacts (code, models, dataset, rl env...) soon! https://t.co/HTxA9HLRv9