StringNLP/longharness
LongHarness Bench: Stress-Testing Language Model Harnesses for Long-Context Reasoning LongHarness evaluates how language-model harnesses access and reason over long contexts. It is designed to distinguish context-access strategies, including direct reading, lexical and semantic retrieval, iterative agents, and recursive language-model harnesses. The benchmark contains 200 evaluation instances across four task suites. Project website Paper GitHub repository… See the full description on the dataset page: https://huggingface.co/datasets/StringNLP/longharness.
Add LongHarness logo to dataset card
Link LongHarness arXiv paper
Match dataset title to paper
Normalize dataset card formatting
Prepare dataset card for public release
Align constraint task with match-only scoring
Add dataset card metadata
Publish LongHarness benchmark snapshot (part 2)
Publish LongHarness benchmark snapshot
initial commit
