ASown/industrial-agent-benchmark
Industry Agent Benchmark
Bảng xếp hạng đo mức độ một AI agent dùng công cụ để xử lý tác vụ multi-step trong nhà máy: chẩn đoán thiết bị, truy nguyên nguyên nhân gốc qua log giao tiếp M2M, gọi hàm (function- calling), an toàn vận hành và hành động. 6 hạng mục, chấm theo chuẩn học thuật (BFCL · τ-bench pass^k · MCC · PR-AUC · AURC · NDCG).
Chạy bằng FastAPI (Docker): leaderboard tương tác + tab Chạy benchmark chấm một mô hình trực tiếp (exec + function-call + quiz) rồi hiện lên bảng xếp hạng, lưu SQLite.
Cần secret (Settings → Variables and secrets): GROQ_API_KEY, CEREBRAS_API_KEY, GEMINI_API_KEY — thiếu key nào thì model của nhà cung cấp đó không chạy được. Mỗi lượt chạy giới hạn 1 job đồng thời + tối đa IAB_MAX_NSTATIC task (chống lạm dụng). Mã nguồn: gói industry_bench trong repo chính.
