Team Ai
Datasetpublic

Zedekiah557/cleaned-humaneval-leetcode

Cleaned HumanEval-LeetCode Dataset Dataset Description 这是一个经过预处理的 LeetCode 代码生成数据集,源自 ShwStone/humaneval-leetcode。 Data Preprocessing (清洗逻辑) 为了直接用于大模型 SFT 训练,原始数据经过了以下清洗: Type Hinting: 根据代码内容,自动注入了 typing (List, Dict, etc.) 和 collections (deque, defaultdict) 的引用。 Class Removal: 移除了 class Solution 外壳,将代码转换为纯函数形式。 Refactoring: 移除了 self 参数,修复了缩进。 Docstring Repair: 修复了 doctest 中的函数调用名称。 Data Structure task_id: 题目唯一标识符。 prompt:… See the full description on the dataset page: https://huggingface.co/datasets/Zedekiah557/cleaned-humaneval-leetcode.

sourceHugging Facemitupdated 8mo agoView on Hugging Face
0likes16downloads
Dataset Card

Cleaned HumanEval-LeetCode Dataset

Dataset Description

这是一个经过预处理的 LeetCode 代码生成数据集,源自 ShwStone/humaneval-leetcode。

Data Preprocessing (清洗逻辑)

为了直接用于大模型 SFT 训练,原始数据经过了以下清洗:

  1. 1.Type Hinting: 根据代码内容,自动注入了 typing (List, Dict, etc.) 和 collections (deque, defaultdict) 的引用。
  2. 2.Class Removal: 移除了 class Solution 外壳,将代码转换为纯函数形式。
  3. 3.Refactoring: 移除了 self 参数,修复了缩进。
  4. 4.Docstring Repair: 修复了 doctest 中的函数调用名称。

Data Structure

  • —task_id: 题目唯一标识符。
  • —prompt: 清洗后的完整题目描述与函数头(可直接输入给 LLM)。

Usage

你可以使用 Hugging Face 的 datasets 库直接加载此数据集:

python
from datasets import load_dataset

# 加载清洗后的训练集
dataset = load_dataset("Zedekiah557/cleaned-humaneval-leetcode", split="train")

# 打印第一条数据
print(dataset[0])