Team Ai
Datasetpublic

kunato/MiMo-V2.6-RL-oss

Agentic RL Environments RL training environments for LLM agents. Domain Task Family Verifier Code Software engineering Executable tests Cyber Vulnerability reproduction Rule checks General Knowledge work Rubric-based judging Visual Web development Visual grading Music Symbolic music composition Rule checks Docker images: https://hub.docker.com/r/xiaomimimo/mimo-v2.6-rl-oss Training code: https://github.com/XiaomiMiMo/verl

sourceHugging Faceapache-2.0updated 10d agoView on Hugging Face
0likes11kdownloads
Dataset Card

Agentic RL Environments

RL training environments for LLM agents.

DomainTask FamilyVerifier
CodeSoftware engineeringExecutable tests
CyberVulnerability reproductionRule checks
GeneralKnowledge workRubric-based judging
VisualWeb developmentVisual grading
MusicSymbolic music compositionRule checks
  • —Docker images: https://hub.docker.com/r/xiaomimimo/mimo-v2.6-rl-oss
  • —Training code: https://github.com/XiaomiMiMo/verl
kunato/MiMo-V2.6-RL-oss · Team Ai