← Back to explorer

OpenResearcher Training Dataset

Type
dataset
Venue
OpenResearcher (TIGER-AI-Lab, Texas A&M University, University of Waterloo)
Year
2026
Source
huggingface
Access
free
Language
English
Added
2026-07-17T20:18:03.727992+00:00
Verified
2026-07-17T20:18:03.727992+00:00

Summary

OpenResearcher-Dataset contains ~96K high-quality long-horizon DeepResearch trajectories with 100+ turns, generated by GPT-OSS-120B using its native browser tools over a self-hosted 15M-document (~11B-token) offline search corpus. SFT on these trajectories yields a 30B-A3B model achieving 54.8% on BrowseComp-Plus (+34 points over base), used by NVIDIA's Nemotron family of models.

Keywords

deep-research agent trajectory browser search synthetic gpt-oss sft

Topics

NLP / Deep Research Agents

Research notes

  • Part of a fully open-source pipeline including model checkpoints and offline search environment (github.com/TIGER-AI-Lab/OpenResearcher). Paper: arxiv 2603.20278.