Team Ai
Datasetpublic

monostate/cebolinha-sft

Dataset Cebolinha SFT Este dataset é derivado do Superar/Puntuguese e transformado para ensinar modelos de linguagem a falar como o Cebolinha, um personagem querido das histórias em quadrinhos brasileiras da "Turma da Mônica" que pronuncia 'r' como 'l'. Aviso Legal / Disclaimer Este dataset é criado apenas para fins educacionais e de pesquisa. Não temos nenhuma relação, afiliação ou autorização da Mauricio de Sousa Produções (MSP), Mauricio de Sousa ou qualquer… See the full description on the dataset page: https://huggingface.co/datasets/monostate/cebolinha-sft.

sourceHugging Facecc-by-sa-4.0updated 11mo agoView on Hugging Face
0likes15downloads
Dataset Card

Dataset Cebolinha SFT

Este dataset é derivado do Superar/Puntuguese e transformado para ensinar modelos de linguagem a falar como o Cebolinha, um personagem querido das histórias em quadrinhos brasileiras da "Turma da Mônica" que pronuncia 'r' como 'l'.

Aviso Legal / Disclaimer

Este dataset é criado apenas para fins educacionais e de pesquisa. Não temos nenhuma relação, afiliação ou autorização da Mauricio de Sousa Produções (MSP), Mauricio de Sousa ou qualquer entidade relacionada à Turma da Mônica. Este trabalho não tem intenções comerciais e é desenvolvido como um projeto de código aberto para a comunidade de PLN em português.

Descrição do Dataset

Este dataset contém piadas e trocadilhos em português transformados para o padrão de fala característico do Cebolinha, formatados para fine-tuning supervisionado (SFT) de modelos de linguagem.

Padrão de Fala do Cebolinha

O Cebolinha é conhecido por sua dislalia, onde ele:

  • —Substitui 'r' por 'l' na maioria dos contextos
  • —Não consegue pronunciar 'rr' (vira 'l')
  • —Mantém o padrão consistentemente em sua fala

Exemplos de transformações:

  • —"rato" → "lato"
  • —"carro" → "calo"
  • —"por favor" → "pol favol"
  • —"terra" → "tela"
  • —"coração" → "colação"

Estrutura do Dataset

Cada exemplo contém:

  • —question: A pergunta ou prompt em português normal
  • —answer: A resposta no estilo Cebolinha

Formato dos Dados

O dataset está estruturado em formato Q&A simples para SFT:

  • —Perguntas que terminam com '?' são separadas da resposta
  • —Textos sem '?' são transformados em prompts com resposta Cebolinha
  • —As respostas sempre estão no estilo característico do Cebolinha

Estatísticas do Dataset

  • —Amostras de treino: 1995
  • —Amostras de validação: 285
  • —Amostras de teste: 570

Fonte

Este dataset é derivado de:

  • —Dataset original: Superar/Puntuguese
  • —Autores originais: Marcio Lima Inacio, Gabriela Wick-Pedro, Renata Ramisch, et al.
  • —Artigo original: "Puntuguese: A Corpus of Puns in Portuguese with Micro-edits" (LREC-COLING 2024)

Uso Pretendido

Este dataset é destinado para:

  • —Fine-tuning de modelos de linguagem para imitar o padrão de fala do Cebolinha
  • —Pesquisa em geração de texto com características específicas de personagens
  • —Fins educacionais e de entretenimento
  • —Pesquisa em PLN para português brasileiro

Considerações Éticas

  • —Este dataset mantém o humor e a natureza lúdica do conteúdo original
  • —A transformação do padrão de fala é baseada em uma característica de personagem fictício
  • —Não tem intenção de zombar ou discriminar pessoas com impedimentos de fala
  • —Deve ser usado com respeito e em contextos apropriados
  • —Uso estritamente educacional, sem fins comerciais

Licença

Este dataset herda a licença CC-BY-SA-4.0 do dataset Puntuguese original.

Citation

If you use this dataset, please cite both this work and the original:

bibtex
@misc{cebolinha-sft-2024,
  title={Cebolinha SFT Dataset},
  author={AutoTrain Contributors},
  year={2024},
  publisher={HuggingFace}
}

@inproceedings{inacio2024puntuguese,
  title={Puntuguese: A Corpus of Puns in Portuguese with Micro-edits},
  author={Inacio, Marcio Lima and Wick-Pedro, Gabriela and Ramisch, Renata and others},
  booktitle={LREC-COLING 2024},
  year={2024}
}