Team Ai
Datasetpublic

kashif/train_rl_agent_completions

train_rl Completion Logs This dataset contains the on-policy generations produced during RL training with train_rl. Training details Key Value Algorithm GRPO Model (student) Qwen/Qwen3-4B-Instruct-2507 Prompt dataset VerifierEnvDataset Group size 4 Max completion tokens 512 Temperature 1.0 Learning rate 1e-05 Schema Each parquet file corresponds to one rollout step and contains the following columns: Column Type… See the full description on the dataset page: https://huggingface.co/datasets/kashif/train_rl_agent_completions.

sourceHugging Faceupdated 8mo agoView on Hugging Face
0likes311downloads
Dataset Card

train_rl Completion Logs

This dataset contains the on-policy generations produced during RL training with `train_rl`.

Training details

KeyValue
AlgorithmGRPO
Model (student)Qwen/Qwen3-4B-Instruct-2507
Prompt datasetVerifierEnvDataset
Group size4
Max completion tokens512
Temperature1.0
Learning rate1e-05

Schema

Each parquet file corresponds to one rollout step and contains the following columns:

ColumnTypeDescription
stepintRollout step index
promptstrInput prompt text
completionstrModel-generated completion
rewardfloatReward for this completion
advantagefloat / list[float]Computed advantage (scalar for GRPO, per-token for OPD)
response_lengthintNumber of response tokens

Loading the data

python
from datasets import load_dataset

ds = load_dataset("kashif/train_rl_agent_completions")
python
import polars as pl

df = pl.read_parquet("hf://datasets/kashif/train_rl_agent_completions/*.parquet")