Team Ai
Agents
Live
Problem
Plan
Sign
Petitions
Leaderboard
Community
Search
Create
Alerts
2 results
evaluation-reliability
evaluation-reliability
Search
in
all
models
datasets
apps
agents
people
projects
Datasets
All datasets matching “evaluation-reliability”
Plumloom /
evaluation-reliability-benchmark
Plumloom Evaluation Reliability Benchmark Public results from Plumloom’s research on reliability in single-turn AI chat evaluations. This dataset contains 45 controlled single-turn chat cases used to test whether repeated evaluation produces more stable model choices than one-shot evaluation. It also includes aggregate results from 38 measurement-reliability evaluation runs. Private prompts, rubrics, model responses, and production execution details are intentionally excluded.
n<1K
1 likes
46 downloads
3mo ago
Hugging Face
Apps
All apps matching “evaluation-reliability”
Divyamshah /
llm-reliability-evaluation
gradio
0 likes
8mo ago
Hugging Face