Team Ai
Apppublic

Danielfonseca1212/LLMEvaluation

sourceHugging Faceupdated 7mo agoView on Hugging Face
0likes
App README

🔬 LLM Evaluation Dashboard

Dashboard de avaliação de qualidade de respostas LLM usando a metodologia G-Eval (Liu et al., NeurIPS 2023) — LLM-as-Judge com Chain-of-Thought scoring em 5 dimensões.

📐 Metodologia

Baseado em G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment (Liu et al., 2023).

Cada dimensão é avaliada por um LLM-judge com CoT scoring:

DimensãoPesoO que mede
Faithfulness30%Fidelidade ao contexto, sem alucinações
Answer Relevance25%Responde diretamente à pergunta?
Completeness20%Cobre todos os aspectos relevantes?
Hallucination Detection15%Afirmações não suportadas pelo contexto
Conciseness10%Sem verbosidade ou padding

Score final: média ponderada com veredicto: EXCELLENT / GOOD / FAIR / POOR

🔧 Features

  • —Avaliação individual — cole pergunta + contexto + resposta → score instantâneo
  • —Comparação side-by-side — compare até 4 modelos/versões com tabela e gauges
  • —Histórico — todas as avaliações da sessão com expandir/colapsar
  • —Exemplos embutidos — 3 casos demonstrativos (boa resposta, alucinação, incompleta)
  • —Reasoning transparente — cada dimensão mostra o raciocínio do juiz

💡 Por que isso demonstra habilidade Senior?

  • —Implementa G-Eval paper em código de produção
  • —LLM-as-Judge com prompts especializados por dimensão
  • —Weighted scoring com normalização
  • —UI de laboratório científico (não é dashboard genérico)
  • —Zero dependências pesadas — 2 libs apenas

⚙️ Secrets

  • —OPENAI_API_KEY

🚀 Local

bash
pip install -r requirements.txt
export OPENAI_API_KEY=sk-...
streamlit run app.py