kashif/train_rl_agent_completions
train_rl Completion Logs This dataset contains the on-policy generations produced during RL training with train_rl. Training details Key Value Algorithm GRPO Model (student) Qwen/Qwen3-4B-Instruct-2507 Prompt dataset VerifierEnvDataset Group size 4 Max completion tokens 512 Temperature 1.0 Learning rate 1e-05 Schema Each parquet file corresponds to one rollout step and contains the following columns: Column Type… See the full description on the dataset page: https://huggingface.co/datasets/kashif/train_rl_agent_completions.
train_rl Completion Logs
This dataset contains the on-policy generations produced during RL training with `train_rl`.
Training details
Schema
Each parquet file corresponds to one rollout step and contains the following columns:
Loading the data
from datasets import load_dataset
ds = load_dataset("kashif/train_rl_agent_completions")import polars as pl
df = pl.read_parquet("hf://datasets/kashif/train_rl_agent_completions/*.parquet")