FerasM10/AI-labeling-framework
0
AI Model Evaluation Framework
Ein interaktives Web-Framework zur Bewertung von KI-Modellen mit automatischer Label-Generierung.
Übersicht
Das AI Model Evaluation Framework ist eine umfassende Lösung zur Bewertung von KI-Modellen basierend auf verschiedenen Metriken wie Qualität, Ressourcenverbrauch, Robustheit und Komplexität. Das Framework generiert automatisch AI Labels im Stil von Energieeffizienz-Labels, die eine schnelle visuelle Bewertung der Modellleistung ermöglichen.
Features
Funktionale Anforderungen
- Task-Auswahl: Dropdown mit allen verfügbaren KI-Tasks (Image Classification, Robustness Evaluation, etc.)
- Dataset-Auswahl: Dynamisch gefiltert nach gewähltem Task mit Metadaten
- Modell-Auswahl: Alle für das Dataset verfügbaren Modelle mit Informationen
- Metriken-Auswahl: Gruppierte Metriken (Quality, Resources, Robustness, Complexity)
- Gewichtung: Slider für Metrik-Gewichtung mit automatischer Normalisierung
- Label-Generierung: Automatische Erstellung von AI Labels als PNG
- Backend-API: Vollständige REST API mit FastAPI
- Responsive Frontend: Moderne, benutzerfreundliche Oberfläche
Technische Features
- Modulare Architektur: Erweiterbar für neue Tasks, Datasets und Metriken
- Clean Code: Lesbarer, wartbarer Code mit umfassender Dokumentation
- Docker Support: Einfache Deployment-Optionen
Verwendung
Schritt-für-Schritt Anleitung
- Datenbank auswählen: Wählen Sie den Datenbank aus
- Dataset auswählen: Wählen Sie ein Dataset für den ausgewählten Datenbank
- Task auswählen: Wählen Sie einen Task für den ausgewählten Dataset
- Umgebung auswählen: Wählen Sie einen Umgebung für das ausgewählte Task
- Modell auswählen: Wählen Sie ein Modell aus der Liste der verfügbaren Modelle
- Metriken auswählen: Wählen Sie die Metriken aus, die bewertet werden sollen
- Gewichtung anpassen: Passen Sie die Gewichtung der Metriken an (Summe muss 1.0 ergeben)
- AI Label generieren: Klicken Sie auf "AI Label generieren" um das Ergebnis zu erstellen
Metrik-Gruppen
- Quality: Qualitätsmetriken wie Accuracy, Precision, etc.
- Resources: Ressourcenverbrauch wie Energie, Laufzeit, etc.
- Robustness: Robustheitsmetriken gegen Adversarial Attacks
- Complexity: Komplexitätsmetriken wie Parameteranzahl, FLOPs, etc.
Gewichtung
Die Gewichtung bestimmt, wie wichtig jede Metrik für den Gesamtscore ist. Die Summe aller Gewichte muss 1.0 ergeben. Höhere Gewichte bedeuten, dass die entsprechende Metrik stärker in den Gesamtscore einfließt.
