datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
huggingface-krew-hackathon2023hotel_datasetsAxolotl-Spanish-Nahuatl
Axolotl-Spanish-Nahuatl : Parallel corpus for Spanish-Nahuatl machine translation
Dataset Collection
In order to get a good translator, we collected and cleaned two of the most complete Nahuatl-Spanish parallel corpora available. Those are Axolotl collected by an expert team at UNAM and Bible UEDIN Nahuatl Spanish crawled by Christos Christodoulopoulos and Mark Steedman from Bible Gateway site.
After this, we ended with 12,207 samples from Axolotl due to misalignments and… See the full description on the dataset page: https://huggingface.co/datasets/somosnlp-hackathon-2022/Axolotl-Spanish-Nahuatl.suicide-comments-es
Dataset Summary
The dataset consists of comments on Reddit, Twitter, and inputs/outputs of the Alpaca dataset translated to Spanish language and classified as suicidal ideation/behavior and non-suicidal.
Dataset Structure
The dataset has 10050 rows (777 considered as Suicidal Ideation/Behavior and 9273 considered Not Suicidal).
Dataset fields
Text: User comment.
Label: 1 if suicidal ideation/behavior; 0 if not suicidal comment.
Dataset Creation… See the full description on the dataset page: https://huggingface.co/datasets/somosnlp-hackathon-2023/suicide-comments-es.Habilidades_Agente_v1
Description
Español:
Presentamos un conjunto de datos que presenta tres partes principales:
1. Dataset sobre habilidades blandas.
2. Dataset de conversaciones empresariales entre agentes y clientes.
3. Dataset curado de Alpaca en español: Este dataset toma como base el dataset https://huggingface.co/datasets/somosnlp/somos-alpaca-es,
y fue curado con la herramienta Argilla, alcanzando 9400 registros curados.
Los datos están estructurados en torno a un método que se describe… See the full description on the dataset page: https://huggingface.co/datasets/somosnlp-hackathon-2023/Habilidades_Agente_v1.es-paremias-variantesParemias con sus variantes para entrenar modelo de embeddings.
Obtenidos de web: https://cvc.cervantes.es/lengua/refranero/listado.aspx
spanish-poetry-datasetThis dataset was previously created in Kaggle by Andrea Morales Garzón.
Link Kaggle
es-paremias-236236 paremias de Cultura Castellana.
Tipos de paremia: Refrán,Refrán meteorológico, Proverbio, Frase proverbial, Aforismo, Locución proverbial, Dialogismo
Obtenidos de web: https://cvc.cervantes.es/lengua/refranero/listado.aspx
Distribución de tipos:
huggingface-krew-hackathon23demo_hackathon
Demo Hackathon Jailbreak Dataset
Curated English dataset for calibrated jailbreak classification.
comentarios_depresivosLa base de datos consta de una cantidad de 192 347 filas de datos para el entrenamiento, 33 944 para las pruebas y 22630 para la validación. Su contenido está compuesto por comentarios suicidas y comentarios normales de la red social Reddit traducidos al español, y obtenidos de la base de datos: Suicide and Depression Detection de Nikhileswar Komati, la cual se puede visualizar en la siguiente dirección: https://www.kaggle.com/datasets/nikhileswarkomati/suicide-watch
Autores
Danny Vásquez… See the full description on the dataset page: https://huggingface.co/datasets/somosnlp-hackathon-2022/comentarios_depresivos.Onexe-QA-Dataset
Dataset Card: Canarian Linguistic Evaluation Dataset (QA without Answers)
Dataset Summary
This dataset has been designed specifically for evaluating the dialectal, linguistic, and cultural understanding of Large Language Models (LLMs) within the context of Canarian Spanish.
It contains 4,683 evaluation questions based on the official lexicon of the Academy of Canarian Language (Academia Canaria de la Lengua - ACL). Each record presents a linguistic query phrased… See the full description on the dataset page: https://huggingface.co/datasets/somosnlp-hackathon-2026/Onexe-QA-Dataset.somosnlp-2026-aerospace
Dataset Card: Conjunto de Datos Aeroespacial y Cultural Completo
Resumen del Dataset
Este conjunto de datos ha sido diseñado específicamente para la evaluación cultural, lingüística y de alineación de Modelos de Lenguaje (LLMs) en el ámbito iberoamericano, con un foco especial en la historia aeroespacial, técnica, científica e histórica.
Contiene 1.716 interacciones de tipo conversacional (multi-turn) distribuidas en múltiples países de habla hispana y portuguesa.… See the full description on the dataset page: https://huggingface.co/datasets/somosnlp-hackathon-2026/somosnlp-2026-aerospace.poems-esDataset descargado de la página kaggle.com.
El archivo original contenía información en inglés y posteriormente fue traducida para su uso.
El dataset contiene las columnas:
Autor: corresponde al autor del poema.
Contenido: contiene todo el poema.
Nombre del poema: contiene el título del poema.
Años: corresponde al tiempo en que fue hecho el poema.
Tipo: contiene el tipo que pertenece el poema.
cenia-team-sabiduriapopularscientific_papers_enes-refranes-145145 refranes cortos de Cultura Castellana.
Obtenidos de web: https://psicologiaymente.com/reflexiones/refranes-cortos
Xavier Molina. (2019, octubre 4). 145 refranes cortos muy populares (y su significado). Portal Psicología y Mente. https://psicologiaymente.com/reflexiones/refranes-cortos
es-refranes-103103 refranes cortos de Cultura Castellana.
Obtenidos de web: https://www.curiosidario.es/refranes-populares-espanoles/
es-refranes-datasetDataset-Acoso-Twitter-Es
UNL: Universidad Nacional de Loja
Miembros del equipo:
Anderson Quizhpe
Luis Negrón
David Pacheco
Bryan Requenes
Paul Pasaca
Hackathon_Datasetpiimask-hackathon
mysqlclient
This project is a fork of MySQLdb1.
This project adds Python 3 support and fixed many bugs.
PyPI: https://pypi.org/project/mysqlclient/
GitHub: https://github.com/PyMySQL/mysqlclient
Support
Do Not use Github Issue Tracker to ask help. OSS Maintainer is not free tech support
When your question looks relating to Python rather than MySQL:
Python mailing list python-list
Slack pythondev.slack.com
Or when you have question about MySQL:
MySQL Community on… See the full description on the dataset page: https://huggingface.co/datasets/arychaud/piimask-hackathon.scientific_papers_en_eshackathon-instruction-finetuninges-paremias-variantes-antonimosAmpliación del dataset es-paremias-variantes con la columna "Frases Antonimas" que pretende ser una frase que tiene el significado completamente opuesto al de la frase variante.
❗Esta columna se ha generado de forma automática utilizando el modelo Phi-4 a través de LMStudio.
La inspección manual de algunos ejemplos valida que sea una frase que mantiene el significado opuesto, pero no todos los ejemplos han sido revisados.
Sientete libre de abrir pull-request con mejoras a este dataset ✨hackathonhack-a-thon-resultdisco_spanish_poetry
DISCO: Diachronic Spanish Sonnet Corpus
The Diachronic Spanish Sonnet Corpus (DISCO) contains sonnets in Spanish in CSV, between the 15th and the 20th centuries (4303 sonnets by 1215 authors from 22 different countries). It includes well-known authors, but also less canonized ones.
This is a CSV compilation taken from the plain text corpus v4 published on git https://github.com/pruizf/disco/tree/v4. It includes the title, author, age and text metadata.
scientific_papers_eshackathon
