pyterrier/quora.pisa
quora.pisa Description A PISA index for the Quora duplicate question dataset Usage # Load the artifact import pyterrier as pt index = pt.Artifact.from_hf('pyterrier/quora.pisa') index.bm25() # returns a BM25 retriever Benchmarks quora/dev name nDCG@10 R@1000 bm25 0.7195 0.9845 dph 0.5893 0.9711 quora/test name nDCG@10 R@1000 bm25 0.7122 0.9875 dph 0.5809 0.9729 Reproduction import… See the full description on the dataset page: https://huggingface.co/datasets/pyterrier/quora.pisa.
030
quora.pisa
Description
A PISA index for the Quora duplicate question dataset
Usage
# Load the artifact
import pyterrier as pt
index = pt.Artifact.from_hf('pyterrier/quora.pisa')
index.bm25() # returns a BM25 retrieverBenchmarks
quora/dev
quora/test
Reproduction
import pyterrier as pt
from tqdm import tqdm
import ir_datasets
from pyterrier_pisa import PisaIndex
index = PisaIndex("quora.pisa", threads=16)
dataset = ir_datasets.load('beir/quora')
docs = ({'docno': d.doc_id, 'text': d.default_text()} for d in tqdm(dataset.docs))
index.index(docs)Metadata
{
"type": "sparse_index",
"format": "pisa",
"package_hint": "pyterrier-pisa",
"stemmer": "porter2"
}