Team Ai
20 results

e5-base

rulins /massive_serve_pes2o_v3_e5_base_v20 likes177 downloads1y agoHugging Faceenzoescipy /wikipedia-longest-stride-chunked-500-embed-intfloat-multilingual-e5-base Wikipedia-Longest-Stride-Chunked-500-Embed-intfloat-multilingual-e5-base This is the embed processed version of Wikipedia-Longest-Stride-Chunked-500 HF Dataset. Computational Resources Used Computational Resources : Colab Pro+ H100 Instance Total Consumed Time : 24h Dataset processing train : 974720 sequences, (1 ~ 512) range length of intfloat/multilingual-e5-base embeddings. test, val : each 1000 sequences, (1 ~ 512) range length of intfloat/multilingual-e5-base embeddings.… See the full description on the dataset page: https://huggingface.co/datasets/enzoescipy/wikipedia-longest-stride-chunked-500-embed-intfloat-multilingual-e5-base.text100K<n<1M0 likes72 downloads7mo agoHugging Faceenzoescipy /wikipedia-longest-salami-chunked-500-embed-intfloat-multilingual-e5-basetext10K<n<100K0 likes39 downloads3mo agoHugging Facekarmiq /wikipedia-embeddings-cs-e5-baseThis dataset contains the Czech subset of the wikimedia/wikipedia dataset. Each page is divided into paragraphs, stored as a list in the chunks column. For every paragraph, embeddings are created using the intfloat/multilingual-e5-base model. Usage Load the dataset: from datasets import load_dataset ds = load_dataset("karmiq/wikipedia-embeddings-cs-e5-base", split="train") ds[1] { 'id': '1', 'url': 'https://cs.wikipedia.org/wiki/Astronomie', 'title': 'Astronomie'… See the full description on the dataset page: https://huggingface.co/datasets/karmiq/wikipedia-embeddings-cs-e5-base.texttext-generation100K<n<1M1 likes34 downloads3y agoHugging Facerulins /massive_serve_dpr_wiki_e5_base_v20 likes27 downloads1y agoHugging Facerulins /massive_serve_dpr_wiki_e5_base_v2_ivfpqtabular10M<n<100M0 likes25 downloads1y agoHugging Face