OpenResearcher Training Dataset
- Type
- dataset
- Venue
- OpenResearcher (TIGER-AI-Lab, Texas A&M University, University of Waterloo)
- Year
- 2026
- Source
- huggingface
- Access
- free
- Language
- English
- Added
- 2026-07-17T20:18:03.727992+00:00
- Verified
- 2026-07-17T20:18:03.727992+00:00
Summary
OpenResearcher-Dataset contains ~96K high-quality long-horizon DeepResearch trajectories with 100+ turns, generated by GPT-OSS-120B using its native browser tools over a self-hosted 15M-document (~11B-token) offline search corpus. SFT on these trajectories yields a 30B-A3B model achieving 54.8% on BrowseComp-Plus (+34 points over base), used by NVIDIA's Nemotron family of models.
Keywords
deep-research agent trajectory browser search synthetic gpt-oss sft
Topics
NLP / Deep Research Agents
Research notes
- Part of a fully open-source pipeline including model checkpoints and offline search environment (github.com/TIGER-AI-Lab/OpenResearcher). Paper: arxiv 2603.20278.