ysn-rfd/text-dataset-tiny-code-script-py-format
USED of tahamajs/medicine_ds_persian for .parquet file USED of Alijafarixcs2/persian-it-llama2-2k for .parquet file USED of Abirate/english_quotes for .jsonl file NEW FILES (05/12/2025) NEW FILES (12/26/2025) NEW FILES (02/15/2026)
31.7k
1{2 "cells": [3 {4 "cell_type": "code",5 "execution_count": 1,6 "id": "6bfa65e2-6aa7-45d3-a52d-8d6339f75501",7 "metadata": {},8 "outputs": [9 {10 "name": "stdout",11 "output_type": "stream",12 "text": [13 "* Running on local URL: http://127.0.0.1:7860\n",14 "* To create a public link, set `share=True` in `launch()`.\n"15 ]16 },17 {18 "data": {19 "text/html": [20 "<div><iframe src=\"http://127.0.0.1:7860/\" width=\"100%\" height=\"500\" allow=\"autoplay; camera; microphone; clipboard-read; clipboard-write;\" frameborder=\"0\" allowfullscreen></iframe></div>"21 ],22 "text/plain": [23 "<IPython.core.display.HTML object>"24 ]25 },26 "metadata": {},27 "output_type": "display_data"28 },29 {30 "data": {31 "text/plain": []32 },33 "execution_count": 1,34 "metadata": {},35 "output_type": "execute_result"36 }37 ],38 "source": [39 "import gradio as gr\n",40 "from transformers import AutoTokenizer, AutoModelForCausalLM\n",41 "import torch\n",42 "\n",43 "# بارگذاری مدل و توکنایزر\n",44 "tokenizer = AutoTokenizer.from_pretrained(\"HooshvareLab/gpt2-fa\")\n",45 "model = AutoModelForCausalLM.from_pretrained(\"HooshvareLab/gpt2-fa\")\n",46 "\n",47 "# تابع تولید متن با دستور\n",48 "def generate_with_instruction(instruction):\n",49 " prompt = f\"دستور: {instruction}\\nپاسخ:\"\n",50 " input_ids = tokenizer.encode(prompt, return_tensors=\"pt\")\n",51 " output = model.generate(\n",52 " input_ids,\n",53 " max_new_tokens=900,\n",54 " do_sample=True,\n",55 " temperature=0.7,\n",56 " top_k=50,\n",57 " top_p=0.92,\n",58 " repetition_penalty=1.3,\n",59 " no_repeat_ngram_size=3,\n",60 " pad_token_id=tokenizer.eos_token_id,\n",61 " eos_token_id=tokenizer.eos_token_id\n",62 " )\n",63 " return tokenizer.decode(output[0], skip_special_tokens=True)\n",64 "\n",65 "# رابط گرافیکی\n",66 "gr.Interface(\n",67 " fn=generate_with_instruction,\n",68 " inputs=gr.Textbox(label=\"📝 دستور وارد کنید\", placeholder=\"مثلاً: دربارهی تاثیر ورزش بر ذهن بنویس\", lines=3),\n",69 " outputs=gr.Textbox(label=\"📄 پاسخ مدل\"),\n",70 " title=\"💬 دستور به مدل GPT2 فارسی\",\n",71 " description=\"با وارد کردن دستور در قالب فارسی، مدل شروع به تولید متن میکند. مثل: نوشتن، خلاصهسازی یا ترجمه.\",\n",72 " theme=\"soft\"\n",73 ").launch()\n"74 ]75 },76 {77 "cell_type": "code",78 "execution_count": 1,79 "id": "b693482a-21c0-483f-bb46-deb050ce82ee",80 "metadata": {},81 "outputs": [82 {83 "name": "stdout",84 "output_type": "stream",85 "text": [86 "* Running on local URL: http://127.0.0.1:7860\n",87 "* To create a public link, set `share=True` in `launch()`.\n"88 ]89 },90 {91 "data": {92 "text/html": [93 "<div><iframe src=\"http://127.0.0.1:7860/\" width=\"100%\" height=\"500\" allow=\"autoplay; camera; microphone; clipboard-read; clipboard-write;\" frameborder=\"0\" allowfullscreen></iframe></div>"94 ],95 "text/plain": [96 "<IPython.core.display.HTML object>"97 ]98 },99 "metadata": {},100 "output_type": "display_data"101 },102 {103 "data": {104 "text/plain": []105 },106 "execution_count": 1,107 "metadata": {},108 "output_type": "execute_result"109 }110 ],111 "source": [112 "import gradio as gr\n",113 "from transformers import GPT2LMHeadModel, GPT2Tokenizer\n",114 "import torch\n",115 "\n",116 "# بارگذاری مدل و توکنایزر\n",117 "model_name = \"HooshvareLab/gpt2-fa\"\n",118 "model = GPT2LMHeadModel.from_pretrained(model_name)\n",119 "tokenizer = GPT2Tokenizer.from_pretrained(model_name)\n",120 "\n",121 "# تنظیم مدل برای تولید متن\n",122 "model.eval()\n",123 "\n",124 "# تابعی برای تولید متن\n",125 "def generate_text(prompt):\n",126 " input_ids = tokenizer.encode(prompt, return_tensors='pt')\n",127 " \n",128 " # تولید متن\n",129 " with torch.no_grad():\n",130 " output = model.generate(input_ids, max_length=100, num_return_sequences=1, no_repeat_ngram_size=2, temperature=0.7)\n",131 "\n",132 " # تبدیل توکنهای خروجی به متن\n",133 " generated_text = tokenizer.decode(output[0], skip_special_tokens=True)\n",134 " \n",135 " return generated_text\n",136 "\n",137 "# تعریف رابط کاربری با Gradio\n",138 "iface = gr.Interface(fn=generate_text, inputs=\"text\", outputs=\"text\", live=True, title=\"تولید متن فارسی با مدل GPT-2\")\n",139 "\n",140 "# اجرا کردن رابط\n",141 "iface.launch()\n"142 ]143 },144 {145 "cell_type": "code",146 "execution_count": null,147 "id": "fc890196-c4bf-4b01-ab3c-0796836f9355",148 "metadata": {},149 "outputs": [],150 "source": []151 }152 ],153 "metadata": {154 "kernelspec": {155 "display_name": "Python [conda env:base] *",156 "language": "python",157 "name": "conda-base-py"158 },159 "language_info": {160 "codemirror_mode": {161 "name": "ipython",162 "version": 3163 },164 "file_extension": ".py",165 "mimetype": "text/x-python",166 "name": "python",167 "nbconvert_exporter": "python",168 "pygments_lexer": "ipython3",169 "version": "3.12.7"170 }171 },172 "nbformat": 4,173 "nbformat_minor": 5174}175 