Team Ai
Datasetpublic

pyterrier/quora.pisa

quora.pisa Description A PISA index for the Quora duplicate question dataset Usage # Load the artifact import pyterrier as pt index = pt.Artifact.from_hf('pyterrier/quora.pisa') index.bm25() # returns a BM25 retriever Benchmarks quora/dev name nDCG@10 R@1000 bm25 0.7195 0.9845 dph 0.5893 0.9711 quora/test name nDCG@10 R@1000 bm25 0.7122 0.9875 dph 0.5809 0.9729 Reproduction import… See the full description on the dataset page: https://huggingface.co/datasets/pyterrier/quora.pisa.

sourceHugging Faceupdated 2y agoView on Hugging Face
0likes30downloads
Dataset Card

quora.pisa

Description

A PISA index for the Quora duplicate question dataset

Usage

python
# Load the artifact
import pyterrier as pt
index = pt.Artifact.from_hf('pyterrier/quora.pisa')
index.bm25() # returns a BM25 retriever

Benchmarks

quora/dev

namenDCG@10R@1000
bm250.71950.9845
dph0.58930.9711

quora/test

namenDCG@10R@1000
bm250.71220.9875
dph0.58090.9729

Reproduction

python
import pyterrier as pt
from tqdm import tqdm
import ir_datasets
from pyterrier_pisa import PisaIndex
index = PisaIndex("quora.pisa", threads=16)
dataset = ir_datasets.load('beir/quora')
docs = ({'docno': d.doc_id, 'text': d.default_text()} for d in tqdm(dataset.docs))
index.index(docs)

Metadata

{
  "type": "sparse_index",
  "format": "pisa",
  "package_hint": "pyterrier-pisa",
  "stemmer": "porter2"
}