minishlab/tokenlearn-cornstack-queries-coderankembed-v2
minishlab/tokenlearn-cornstack-queries-coderankembed-v2 Dataset Card This dataset was created with Tokenlearn for training Model2Vec models on code retrieval. It contains mean token embeddings produced by nomic-ai/CodeRankEmbed, used as training targets for static embedding distillation. The dataset contains code documents from CornStack across 6 programming languages (100,000 rows per language, 600,000 total). Dataset Details Field Value Source… See the full description on the dataset page: https://huggingface.co/datasets/minishlab/tokenlearn-cornstack-queries-coderankembed-v2.
Conversations for this repository live on Hugging Face.
Team Ai shows imported repositories read-only. Posting into someone else’s repository from here would need an authorised integration and the account holder’s consent, so the link goes to the source instead.
Open discussions on Hugging Face