MiniLM
Datasets
All datasets matching “MiniLM”wikipedia-22-12-en-embeddings-all-MiniLM-L6-v2
Dataset Card for "wikipedia-22-12-en-embeddings-all-MiniLM-L6-v2"
More Information needed
msmarco-msmarco-MiniLM-L6-v3
MS MARCO with hard negatives from msmarco-MiniLM-L6-v3
MS MARCO is a large scale information retrieval corpus that was created based on real user search queries using the Bing search engine.
For each query and gold positive passage, the 50 most similar paragraphs were mined using 13 different models. The resulting data can be used to train Sentence Transformer models.
Related Datasets
These are the datasets generated using the 13 different models:
msmarco-bm25… See the full description on the dataset page: https://huggingface.co/datasets/sentence-transformers/msmarco-msmarco-MiniLM-L6-v3.malicious-prompts-minilm-embeddingsenwiki20230101-pageid-minilml6v2embeddings
Dataset Card for "enwiki20230101-pageid-minilml6v2embeddings"
More Information needed
enwiki20230101-pageid-minilml6v2embeddingsjson
Dataset Card for "enwiki20230101-pageid-minilml6v2embeddingsjson"
More Information needed
openwebtext-all-minilm-l6-v2-embedding
Dataset Card for "openwebtext-all-minilm-l6-v2-embedding"
More Information needed
