Team Ai
8 shown

datasets

Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.

Clear all
01minishlab /tokenlearn-c4-multilingual-bge-m3 minishlab/tokenlearn-c4-multilingual-bge-m3 Dataset Card This dataset was created with Tokenlearn for training Model2Vec models. It contains mean token embeddings produced by a sentence transformer, used as training targets for static embedding distillation. Dataset Details Field Value Source dataset allenai/c4 Source split train Embedding model BAAI/bge-m3 Embedding dimension 1024 Rows 9999954 Dataset Structure Column Type… See the full description on the dataset page: https://huggingface.co/datasets/minishlab/tokenlearn-c4-multilingual-bge-m3.text10M<n<100M2 likes563 downloads7mo agoHugging Face02minishlab /tokenlearn-c4-en-bge-base-en-v1.5 minishlab/tokenlearn-c4-en-bge-base-v1.5 Dataset Card This dataset was created with Tokenlearn for training Model2Vec models. It contains mean token embeddings produced by a sentence transformer, used as training targets for static embedding distillation. Dataset Details Field Value Source dataset allenai/c4 Source split train Embedding model baai/bge-base-en-v1.5 Embedding dimension 768 Rows 10000000 Dataset Structure Column… See the full description on the dataset page: https://huggingface.co/datasets/minishlab/tokenlearn-c4-en-bge-base-en-v1.5.text10M<n<100M2 likes190 downloads7mo agoHugging Face03applewpj /token-learning-spectrum-examples Token Learning Spectrum Examples This dataset hosts public losses.npz matrices for reproducing the figures in the Token Learning Spectrum code release. Each losses.npz follows the schema documented in the GitHub repository: axis_values: float array [K] loss_matrix: float array [N, K] axis_name: string array [1] sample_id, token_pos, and metadata arrays: optional arrays [N] Files are listed in manifest.yaml with shapes, byte sizes, and SHA256 checksums. Download them with:… See the full description on the dataset page: https://huggingface.co/datasets/applewpj/token-learning-spectrum-examples.0 likes59 downloads3mo agoHugging Face04minishlab /tokenlearn-cornstack-docs-coderankembed minishlab/tokenlearn-cornstack-docs-coderankembed Dataset Card This dataset was created with Tokenlearn for training Model2Vec models on code retrieval. It contains mean token embeddings produced by nomic-ai/CodeRankEmbed, used as training targets for static embedding distillation. The dataset contains code documents from CornStack across 6 programming languages (50,000 rows per language, 300,000 total). Dataset Details Field Value SourceCornStack… See the full description on the dataset page: https://huggingface.co/datasets/minishlab/tokenlearn-cornstack-docs-coderankembed.text100K<n<1M2 likes44 downloads5mo agoHugging Face05minishlab /tokenlearn-cornstack-docs-coderankembed-v2 minishlab/tokenlearn-cornstack-docs-coderankembed-v2 Dataset Card This dataset was created with Tokenlearn for training Model2Vec models on code retrieval. It contains mean token embeddings produced by nomic-ai/CodeRankEmbed, used as training targets for static embedding distillation. The dataset contains code documents from CornStack across 6 programming languages (100,000 rows per language, 600,000 total). Dataset Details Field Value SourceCornStack… See the full description on the dataset page: https://huggingface.co/datasets/minishlab/tokenlearn-cornstack-docs-coderankembed-v2.text100K<n<1M1 likes34 downloads5mo agoHugging Face06minishlab /tokenlearn-cornstack-queries-coderankembed-v2 minishlab/tokenlearn-cornstack-queries-coderankembed-v2 Dataset Card This dataset was created with Tokenlearn for training Model2Vec models on code retrieval. It contains mean token embeddings produced by nomic-ai/CodeRankEmbed, used as training targets for static embedding distillation. The dataset contains code documents from CornStack across 6 programming languages (100,000 rows per language, 600,000 total). Dataset Details Field Value SourceCornStack… See the full description on the dataset page: https://huggingface.co/datasets/minishlab/tokenlearn-cornstack-queries-coderankembed-v2.text100K<n<1M1 likes29 downloads5mo agoHugging Face07minishlab /tokenlearn-cornstack-queries-coderankembed minishlab/tokenlearn-cornstack-queries-coderankembed Dataset Card This dataset was created with Tokenlearn for training Model2Vec models on code retrieval. It contains mean token embeddings produced by nomic-ai/CodeRankEmbed, used as training targets for static embedding distillation. The dataset contains natural language queries from CornStack across 6 programming languages (50,000 rows per language, 300,000 total). Dataset Details Field Value Source… See the full description on the dataset page: https://huggingface.co/datasets/minishlab/tokenlearn-cornstack-queries-coderankembed.text100K<n<1M2 likes27 downloads5mo agoHugging Face08minishlab /tokenlearn_C42 likes8 downloads2y agoHugging Face

Listings come live from the Hugging Face Hub API. Team Ai does not host these files.