Team Ai
Apppublic

ASown/industrial-agent-benchmark

sourceHugging Faceupdated 3mo agoView on Hugging Face
1likes
App README

Industry Agent Benchmark

Bảng xếp hạng đo mức độ một AI agent dùng công cụ để xử lý tác vụ multi-step trong nhà máy: chẩn đoán thiết bị, truy nguyên nguyên nhân gốc qua log giao tiếp M2M, gọi hàm (function- calling), an toàn vận hành và hành động. 6 hạng mục, chấm theo chuẩn học thuật (BFCL · τ-bench pass^k · MCC · PR-AUC · AURC · NDCG).

Chạy bằng FastAPI (Docker): leaderboard tương tác + tab Chạy benchmark chấm một mô hình trực tiếp (exec + function-call + quiz) rồi hiện lên bảng xếp hạng, lưu SQLite.

Cần secret (Settings → Variables and secrets): GROQ_API_KEY, CEREBRAS_API_KEY, GEMINI_API_KEY — thiếu key nào thì model của nhà cung cấp đó không chạy được. Mỗi lượt chạy giới hạn 1 job đồng thời + tối đa IAB_MAX_NSTATIC task (chống lạm dụng). Mã nguồn: gói industry_bench trong repo chính.