OpenEnv Integration for Training LLMs with Environments
- Type
- other
- Venue
- Hugging Face TRL docs
- Year
- 2026
- Source
- huggingface
- Access
- free
- Language
- en
- Added
- 2026-08-14T19:25:00Z
- Verified
- 2026-08-14T19:25:00Z
Summary
Living TRL docs (main). White-box path: environment_factory plus GRPOTrainer auto-discovers public tool methods, runs the multi-turn loop, and reads env.reward (Echo, Wordle, multi-env Wordle+Catch). Black-box/harness path (experimental): HarnessRolloutWorker plus AsyncGRPOTrainer lets a production agent such as opencode own planner, tools, and stop condition inside an OpenEnv ResourceSession; a transparent_proxy records token ids and logprobs; verify() plus optional rollout_reward_fn / train_turn_fn / agent_turn_fn score the outcome and filter turns. Reference script examples/scripts/openenv/opencode.py on agentica-org/DeepCoder-Preview-Dataset; sibling HF-sandbox script for multi-node rollouts. OpenEnv itself is Gymnasium-style step/reset/state with Hub-hosted Spaces. Discord posted the opencode harness hash.
Keywords
openenv · trl · grpo · opencode · harness · rl · huggingface · blog
Topics
RL post-training, agent environments, coding agents
Research notes
- Primary: TRL OpenEnv docs (posted link, including #training-on-harnesses-training-a-real-coding-agent-opencode). OpenEnv https://github.com/huggingface/OpenEnv (BSD-3-Clause). TRL https://github.com/huggingface/trl (Apache-2.0). OpenEnv docs https://huggingface.co/docs/openenv/. Example dataset DeepCoder-Preview-Dataset is prior, not a new corpus here. Docs/integration, not a hosted corpus, so no datasets_local row.
- 2026-10-01: capture proxy release (OpenEnv PR #1036) announced via @ben_burtenshaw X post (https://x.com/ben_burtenshaw/status/2105681647018315903): proxy sits between harness and model, records exact token ids and logprobs of every call, appears to harness as another model provider; typed TrainingTrace API (OpenEnv PR #1280); TRL async GRPO HarnessRolloutWorker (trl PR #6947)