Team Ai
Modelpublic

Rafael0301/modelo_qa_beto_docstride_pdqa

sourceHugging Faceupdated 2mo agoView on Hugging Face
1likes7downloads
Model Card

modeloqabetodocstridepdqa

Descripción

Modelo desarrollado para el Dominican News Question Answering Challenge de ICC-344-T. El sistema recibe una pregunta y un contexto noticioso, y extrae una respuesta contenida explícitamente en el contexto.

El modelo fue obtenido mediante fine-tuning de BETO utilizando el conjunto de datos PDQA y evaluando distintas configuraciones de entrenamiento para seleccionar la de mejor desempeño.

Integrantes

  • —Emil Paulino - 10154329
  • —Rafael Ramírez - 10149810

Recursos oficiales

  • —Dataset: https://huggingface.co/datasets/Lisibonny/pdqa
  • —Baseline: https://huggingface.co/Lisibonny/modeloqabetosquades_pdqa
  • —Aplicación: https://huggingface.co/spaces/Lisibonny/Repartidor_Dominicano

Modelo base

  • —Repositorio: Lisibonny/modeloqabetosquades_pdqa
  • —Justificación: Se utilizó el baseline oficial del proyecto, previamente afinado para Question Answering en español, y posteriormente se realizó fine-tuning utilizando el conjunto PDQA.

Datos

DivisiónFilasUso
train45Entrenamiento
validation15Comparación y selección
test20Predicciones finales

No se publicaron ni utilizaron respuestas privadas de test.

Entrenamiento

ParámetroValor
Seed42
Learning rate2e-5
Batch size8
Épocas5
Max length384
Doc stride128
Weight decay0.01
HardwareGoogle Colab (GPU)

Experimentos

ExperimentoCambioEM validationF1 validation
Baseline oficialSin cambios60.0075.84
Variante 1Fine-tuning (1 época)53.3373.62
Variante 2Fine-tuning (3 épocas)66.6777.70
Modelo finalFine-tuning (5 épocas + DocStride)73.3380.15

Ablación o comparación controlada

Se realizaron dos comparaciones controladas. Primero se evaluó el efecto del número de épocas (1, 3 y 5), manteniendo constantes el modelo base, learning rate, batch size, seed y demás hiperparámetros. Posteriormente se evaluó el uso de DocStride para el manejo de contextos largos, manteniendo constante la mejor configuración obtenida en la primera comparación.

Resultados

  • —Exact Match en validation: 73.33
  • —F1 en validation: 80.15
  • —Script de evaluación: 05_evaluate_qa.py

Ejemplo de uso

python
from transformers import pipeline

qa = pipeline(
    "question-answering",
    model="Rafael0301/modelo_qa_beto_docstride_pdqa",
    tokenizer="Rafael0301/modelo_qa_beto_docstride_pdqa"
)

qa(
    question="¿Quién hizo el anuncio?",
    context="La ministra informó que el programa comenzará en agosto."
)

Análisis de errores

  1. 1.Respuestas parcialmente correctas cuando varias frases similares aparecen en el contexto.
  2. 2.Confusión entre entidades con nombres o cargos similares.
  3. 3.Errores en preguntas cuya respuesta se encuentra cerca del límite del contexto o en noticias con información muy extensa.

Limitaciones

  • —La respuesta debe estar presente en el contexto.
  • —El modelo puede confundir entidades, fechas o cantidades similares.
  • —El modelo no verifica la veracidad de la noticia.
  • —No debe utilizarse como única fuente para decisiones de alto impacto.

Reproducibilidad

  • —Repositorio de código: https://github.com/emilpaulino/modeloqabetodocstridepdqa
  • —Commit: f9eb8e5
  • —Notebook: 03_QA_Noticias_Equipo_Rafael_Emil.ipynb
  • —Archivo de dependencias: 09_requirements.txt
  • —Semillas: 42