Team Ai
Modelpublic

ranksaga/ranksaga-optimized-e5-v2

sourceHugging Facemitupdated 9mo agoView on Hugging Face
3likes
Model Card

ranksaga-optimized-e5-v2

This is a fine-tuned embedding model optimized by RankSaga for information retrieval tasks. It's based on intfloat/e5-base-v2 and has been optimized using advanced fine-tuning techniques on BEIR benchmark datasets.

Model Details

Base Model

  • —Base Model: intfloat/e5-base-v2
  • —Architecture: E5 (Embeddings from bidirectional Encoder representations)
  • —Model Type: Sentence Transformer

Training

  • —Fine-tuning Method: Multiple Negatives Ranking Loss
  • —Training Datasets: BEIR datasets (scifact, nfcorpus, scidocs, quora)
  • —Epochs: 5
  • —Batch Size: 32
  • —Learning Rate: 1e-5
  • —Mixed Precision: FP16

Optimization Results

The model was evaluated on BEIR benchmark datasets and shows significant improvements on technical domains:

NFE Corpus (Medical Information Retrieval):

  • —NDCG@10: +15.25% improvement
  • —NDCG@100: +32.62% improvement
  • —MAP@100: +49.49% improvement
  • —Recall@100: +51.03% improvement

SciDocs (Scientific Document Retrieval):

  • —NDCG@10: +3.14% improvement
  • —NDCG@100: +11.82% improvement
  • —MAP@100: +7.70% improvement
  • —Recall@100: +20.21% improvement

Quora (General Semantic Similarity):

  • —Maintained high baseline performance (NDCG@10: 0.8472)

Usage

Using Sentence Transformers

python
from sentence_transformers import SentenceTransformer

model = SentenceTransformer("RankSaga/ranksaga-optimized-e5-v2")

# Encode sentences
sentences = [
    "What is the capital of France?",
    "Paris is the capital of France."
]
embeddings = model.encode(sentences)

# Compute similarity
from sentence_transformers.util import cos_sim
similarity = cos_sim(embeddings[0], embeddings[1])
print(f"Similarity: {similarity.item():.4f}")

Using for Information Retrieval

python
from sentence_transformers import SentenceTransformer
from sentence_transformers.util import cos_sim

model = SentenceTransformer("RankSaga/ranksaga-optimized-e5-v2")

# Encode documents
documents = [
    "Machine learning is a subset of artificial intelligence.",
    "Python is a popular programming language.",
    "Deep learning uses neural networks with multiple layers."
]
doc_embeddings = model.encode(documents)

# Encode query
query = "What is machine learning?"
query_embedding = model.encode(query)

# Find most similar documents
similarities = cos_sim(query_embedding, doc_embeddings)[0]
top_result_idx = similarities.argmax().item()

print(f"Query: {query}")
print(f"Most relevant document: {documents[top_result_idx]}")
print(f"Similarity: {similarities[top_result_idx].item():.4f}")

Using with Hugging Face Transformers

python
from transformers import AutoTokenizer, AutoModel
import torch

tokenizer = AutoTokenizer.from_pretrained("RankSaga/ranksaga-optimized-e5-v2")
model = AutoModel.from_pretrained("RankSaga/ranksaga-optimized-e5-v2")

# Encode
inputs = tokenizer("What is machine learning?", return_tensors="pt")
with torch.no_grad():
    outputs = model(**inputs)
    embeddings = outputs.last_hidden_state.mean(dim=1)

Evaluation

The model was evaluated on the BEIR benchmark suite:

DatasetNDCG@10NDCG@100MAP@100Recall@100
NFE Corpus0.39210.41870.23730.4830
SciDocs0.17670.27260.12460.4782
Quora0.84720.86310.81210.9865
SciFact0.51370.55630.46580.8684

For detailed results and comparisons, see our benchmarking blog post and GitHub repository.

Limitations

  • —The model performs best on technical and domain-specific content (medical, scientific)
  • —Performance on general tasks may be similar to or slightly lower than the base model
  • —Model size: ~110M parameters
  • —Requires sentence-transformers library for optimal usage

Training Data

The model was fine-tuned on:

  • —SciFact: Scientific fact-checking dataset (300 queries, 5K documents)
  • —NFE Corpus: Medical information retrieval (323 queries, 3.6K documents)
  • —SciDocs: Scientific document retrieval (1K queries, 25K documents)
  • —Quora: Duplicate question detection (10K queries, 523K documents)

All datasets are part of the BEIR benchmark suite.

Citation

If you use this model, please cite:

bibtex
@misc{ranksaga-optimized-e5-v2,
  title={RankSaga Optimized E5-v2: Fine-tuned Embedding Model for Information Retrieval},
  author={RankSaga},
  year={2026},
  url={https://huggingface.co/RankSaga/ranksaga-optimized-e5-v2}
}

License

This model is licensed under the MIT License. See the LICENSE file for details.

Contact

For questions, issues, or commercial inquiries:

Acknowledgments