datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
coder-maxFIXED-Cleaned-Claude-Sonnet-5-Grok-4.5-ChatGPT-5.6-Luna-Qwen-3.8-MAX
Ultra-Clean HF Dataset
492 pairs. Zero residual JSON garbage. High-tier technical SFT data.
gpt-5.1-codex-max-1000x
GPT 5.1 Codex Max - 1,000x
This is a reasoning dataset created using GPT 5.1 Codex Max with a reasoning depth set to high.
The dataset is meant for creating distilled versions of GPT 5.1 Codex Max by fine-tuning already existing open-source LLMs.
This datasets prompts are adapted versions of our standard set of prompts, designed to provoke complex reasoning.
Stats
Costs: $ 23.51 (USD)
Total tokens (input + output): 2.39 M
Generated using DataGen by TeichAI
burme-coder-max
burme-coder-max
Burmese (Myanmar) Coding Assistant Dataset for training AI coding models.
Dataset Information
Total Rows: 310
Format: Parquet
Columns: system, instruction, response
Topics Covered
Python, JavaScript, TypeScript, Go, Rust programming
REST API development
Database operations
DevOps and deployment
Data structures and algorithms
Knowledge Base & RAG Systems
Data File Handling (CSV, JSON, Excel)
API Integration Patterns
Error Handling… See the full description on the dataset page: https://huggingface.co/datasets/amkyawdev/burme-coder-max.swe_gym_491i_max_loop_size_2dcagent-dev-set-71-tasks-dcagent-code-contests-sandboxes-traces-terminus-2-max-61543509dcagent-dev-set-71-tasks-dcagent-code-contests-sandboxes-traces-terminus-2-max-70610986dcagent-dev-set-71-tasks-dcagent-code-contests-sandboxes-traces-terminus-2-max-90271432dcagent-dev-set-71-tasks-dcagent-code-contests-sandboxes-traces-terminus-2-max-10071630dcagent-dev-set-71-tasks-dcagent-code-contests-sandboxes-traces-terminus-2-max-33354495code-contests-sandboxes-traces-terminus-2_max-grad-norm_0.05_Qwen3-8BDCAgent_dev_set_71_tasks_DCAgent_code-contests-sandboxes-traces-terminus-2_max-s1ce8f3f2DCAgent_dev_set_71_tasks_DCAgent_code-contests-sandboxes-traces-terminus-2_max-g2f7ad195DCAgent_dev_set_71_tasks_DCAgent_code-contests-sandboxes-traces-terminus-2_max-g5d4ddef1DCAgent_dev_set_71_tasks_DCAgent_code-contests-sandboxes-traces-terminus-2_max-g97c7b476DCAgent_dev_set_71_tasks_DCAgent_code-contests-sandboxes-traces-terminus-2_max-g182f30d2DCAgent_dev_set_71_tasks_DCAgent_code-contests-sandboxes-traces-terminus-2_max-g8138dde5DCAgent_dev_set_71_tasks_DCAgent_code-contests-sandboxes-traces-terminus-2_max-g50d8f5a5DCAgent_dev_set_71_tasks_DCAgent_code-contests-sandboxes-traces-terminus-2_max-s4ba4cd43DCAgent_dev_set_71_tasks_DCAgent_code-contests-sandboxes-traces-terminus-2_max-sad32e916DCAgent_dev_set_71_tasks_DCAgent_code-contests-sandboxes-traces-terminus-2_max-gf1d6467bDCAgent_dev_set_71_tasks_DCAgent_code-contests-sandboxes-traces-terminus-2_max-g7e507200DCAgent_dev_set_71_tasks_DCAgent_code-contests-sandboxes-traces-terminus-2_max-gf5efc727DCAgent_dev_set_71_tasks_DCAgent_code-contests-sandboxes-traces-terminus-2_max-sf48eade4gpt-5.1-codex-max-1000x
GPT 5.1 Codex Max - 1,000x
This is a reasoning dataset created using GPT 5.1 Codex Max with a reasoning depth set to high.
The dataset is meant for creating distilled versions of GPT 5.1 Codex Max by fine-tuning already existing open-source LLMs.
This datasets prompts are adapted versions of our standard set of prompts, designed to provoke complex reasoning.
Stats
Costs: $ 23.51 (USD)
Total tokens (input + output): 2.39 M
Generated using DataGen by TeichAI
5.1-codex-maxDCAgent_dev_set_71_tasks_DCAgent_code-contests-sandboxes-traces-terminus-2_max-g26802bcfDCAgent_dev_set_71_tasks_DCAgent_code-contests-sandboxes-traces-terminus-2_max-gb2690d95combined_repo_max_diversity_500idcagent-dev-set-71-tasks-dcagent-code-contests-sandboxes-traces-terminus-2-max-34190345
