RaR-Medicine-20k-o3-mini
- Type
- dataset
- Venue
- HuggingFace (anisha2102)
- Year
- 2026
- Source
- huggingface
- Access
- free
- Language
- English
- Added
- 2026-07-17T20:18:03.706305+00:00
- Verified
- 2026-07-17T20:18:03.706305+00:00
Summary
RaR-Medicine-20k-o3-mini is a dataset of ~22.4k medical questions (17.9k train / 2.24k val / 2.24k test) each paired with a reference answer and checklist-style rubric criteria generated by OpenAI's o3-mini model. It is released as part of the 'Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains' paper (arXiv:2507.17746) to enable structured, multi-criteria reward supervision for RL training of language models on medical reasoning tasks.
Keywords
rubrics reinforcement-learning medicine reasoning rewards o3-mini rlvr
Topics
Medicine / Reasoning
Research notes
- Part of the Rubrics as Rewards (RaR) framework. Source questions appear to come from FreedomIntelligence/medical-1-reasoning-SFT and similar medical QA datasets. Rubrics generated by o3-mini.