Danielfonseca1212/LLMEvaluation
0
🔬 LLM Evaluation Dashboard
Dashboard de avaliação de qualidade de respostas LLM usando a metodologia G-Eval (Liu et al., NeurIPS 2023) — LLM-as-Judge com Chain-of-Thought scoring em 5 dimensões.
📐 Metodologia
Baseado em G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment (Liu et al., 2023).
Cada dimensão é avaliada por um LLM-judge com CoT scoring:
Score final: média ponderada com veredicto: EXCELLENT / GOOD / FAIR / POOR
🔧 Features
- Avaliação individual — cole pergunta + contexto + resposta → score instantâneo
- Comparação side-by-side — compare até 4 modelos/versões com tabela e gauges
- Histórico — todas as avaliações da sessão com expandir/colapsar
- Exemplos embutidos — 3 casos demonstrativos (boa resposta, alucinação, incompleta)
- Reasoning transparente — cada dimensão mostra o raciocínio do juiz
💡 Por que isso demonstra habilidade Senior?
- Implementa G-Eval paper em código de produção
- LLM-as-Judge com prompts especializados por dimensão
- Weighted scoring com normalização
- UI de laboratório científico (não é dashboard genérico)
- Zero dependências pesadas — 2 libs apenas
⚙️ Secrets
OPENAI_API_KEY
🚀 Local
pip install -r requirements.txt
export OPENAI_API_KEY=sk-...
streamlit run app.py