← Back to explorer

RaR-Science-20k-o3-mini

Type
dataset
Venue
HuggingFace (anisha2102)
Year
2026
Source
huggingface
Access
free
Language
English
Added
2026-07-17T20:18:03.704464+00:00
Verified
2026-07-17T20:18:03.704464+00:00

Summary

RaR-Science-20k-o3-mini is a dataset of ~22.9k science questions (18.3k train / 2.29k val / 2.29k test) each paired with a reference answer and checklist-style rubric criteria generated by OpenAI's o3-mini model. It is released as part of the 'Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains' paper (arXiv:2507.17746) to enable structured, multi-criteria reward supervision for RL training of language models on science reasoning tasks.

Keywords

rubrics reinforcement-learning science reasoning rewards o3-mini rlvr

Topics

Science / Reasoning

Research notes

  • Part of the Rubrics as Rewards (RaR) framework. Source questions appear to come from science QA datasets (e.g. SciBench, GPQA-style problems). Rubrics generated by o3-mini.