Team Ai
Datasetpublic

ysn-rfd/text-dataset-tiny-code-script-py-format

USED of tahamajs/medicine_ds_persian for .parquet file USED of Alijafarixcs2/persian-it-llama2-2k for .parquet file USED of Abirate/english_quotes for .jsonl file NEW FILES (05/12/2025) NEW FILES (12/26/2025) NEW FILES (02/15/2026)

sourceHugging Faceapache-2.0updated 4mo agoView on Hugging Face
3likes1.7kdownloads
Untitled1.ipynb175 linesDownload Raw Back to opencv_test
1{2 "cells": [3  {4   "cell_type": "code",5   "execution_count": 1,6   "id": "6bfa65e2-6aa7-45d3-a52d-8d6339f75501",7   "metadata": {},8   "outputs": [9    {10     "name": "stdout",11     "output_type": "stream",12     "text": [13      "* Running on local URL:  http://127.0.0.1:7860\n",14      "* To create a public link, set `share=True` in `launch()`.\n"15     ]16    },17    {18     "data": {19      "text/html": [20       "<div><iframe src=\"http://127.0.0.1:7860/\" width=\"100%\" height=\"500\" allow=\"autoplay; camera; microphone; clipboard-read; clipboard-write;\" frameborder=\"0\" allowfullscreen></iframe></div>"21      ],22      "text/plain": [23       "<IPython.core.display.HTML object>"24      ]25     },26     "metadata": {},27     "output_type": "display_data"28    },29    {30     "data": {31      "text/plain": []32     },33     "execution_count": 1,34     "metadata": {},35     "output_type": "execute_result"36    }37   ],38   "source": [39    "import gradio as gr\n",40    "from transformers import AutoTokenizer, AutoModelForCausalLM\n",41    "import torch\n",42    "\n",43    "# بارگذاری مدل و توکنایزر\n",44    "tokenizer = AutoTokenizer.from_pretrained(\"HooshvareLab/gpt2-fa\")\n",45    "model = AutoModelForCausalLM.from_pretrained(\"HooshvareLab/gpt2-fa\")\n",46    "\n",47    "# تابع تولید متن با دستور\n",48    "def generate_with_instruction(instruction):\n",49    "    prompt = f\"دستور: {instruction}\\nپاسخ:\"\n",50    "    input_ids = tokenizer.encode(prompt, return_tensors=\"pt\")\n",51    "    output = model.generate(\n",52    "        input_ids,\n",53    "        max_new_tokens=900,\n",54    "        do_sample=True,\n",55    "        temperature=0.7,\n",56    "        top_k=50,\n",57    "        top_p=0.92,\n",58    "        repetition_penalty=1.3,\n",59    "        no_repeat_ngram_size=3,\n",60    "        pad_token_id=tokenizer.eos_token_id,\n",61    "        eos_token_id=tokenizer.eos_token_id\n",62    "    )\n",63    "    return tokenizer.decode(output[0], skip_special_tokens=True)\n",64    "\n",65    "# رابط گرافیکی\n",66    "gr.Interface(\n",67    "    fn=generate_with_instruction,\n",68    "    inputs=gr.Textbox(label=\"📝 دستور وارد کنید\", placeholder=\"مثلاً: درباره‌ی تاثیر ورزش بر ذهن بنویس\", lines=3),\n",69    "    outputs=gr.Textbox(label=\"📄 پاسخ مدل\"),\n",70    "    title=\"💬 دستور به مدل GPT2 فارسی\",\n",71    "    description=\"با وارد کردن دستور در قالب فارسی، مدل شروع به تولید متن می‌کند. مثل: نوشتن، خلاصه‌سازی یا ترجمه.\",\n",72    "    theme=\"soft\"\n",73    ").launch()\n"74   ]75  },76  {77   "cell_type": "code",78   "execution_count": 1,79   "id": "b693482a-21c0-483f-bb46-deb050ce82ee",80   "metadata": {},81   "outputs": [82    {83     "name": "stdout",84     "output_type": "stream",85     "text": [86      "* Running on local URL:  http://127.0.0.1:7860\n",87      "* To create a public link, set `share=True` in `launch()`.\n"88     ]89    },90    {91     "data": {92      "text/html": [93       "<div><iframe src=\"http://127.0.0.1:7860/\" width=\"100%\" height=\"500\" allow=\"autoplay; camera; microphone; clipboard-read; clipboard-write;\" frameborder=\"0\" allowfullscreen></iframe></div>"94      ],95      "text/plain": [96       "<IPython.core.display.HTML object>"97      ]98     },99     "metadata": {},100     "output_type": "display_data"101    },102    {103     "data": {104      "text/plain": []105     },106     "execution_count": 1,107     "metadata": {},108     "output_type": "execute_result"109    }110   ],111   "source": [112    "import gradio as gr\n",113    "from transformers import GPT2LMHeadModel, GPT2Tokenizer\n",114    "import torch\n",115    "\n",116    "# بارگذاری مدل و توکنایزر\n",117    "model_name = \"HooshvareLab/gpt2-fa\"\n",118    "model = GPT2LMHeadModel.from_pretrained(model_name)\n",119    "tokenizer = GPT2Tokenizer.from_pretrained(model_name)\n",120    "\n",121    "# تنظیم مدل برای تولید متن\n",122    "model.eval()\n",123    "\n",124    "# تابعی برای تولید متن\n",125    "def generate_text(prompt):\n",126    "    input_ids = tokenizer.encode(prompt, return_tensors='pt')\n",127    "    \n",128    "    # تولید متن\n",129    "    with torch.no_grad():\n",130    "        output = model.generate(input_ids, max_length=100, num_return_sequences=1, no_repeat_ngram_size=2, temperature=0.7)\n",131    "\n",132    "    # تبدیل توکن‌های خروجی به متن\n",133    "    generated_text = tokenizer.decode(output[0], skip_special_tokens=True)\n",134    "    \n",135    "    return generated_text\n",136    "\n",137    "# تعریف رابط کاربری با Gradio\n",138    "iface = gr.Interface(fn=generate_text, inputs=\"text\", outputs=\"text\", live=True, title=\"تولید متن فارسی با مدل GPT-2\")\n",139    "\n",140    "# اجرا کردن رابط\n",141    "iface.launch()\n"142   ]143  },144  {145   "cell_type": "code",146   "execution_count": null,147   "id": "fc890196-c4bf-4b01-ab3c-0796836f9355",148   "metadata": {},149   "outputs": [],150   "source": []151  }152 ],153 "metadata": {154  "kernelspec": {155   "display_name": "Python [conda env:base] *",156   "language": "python",157   "name": "conda-base-py"158  },159  "language_info": {160   "codemirror_mode": {161    "name": "ipython",162    "version": 3163   },164   "file_extension": ".py",165   "mimetype": "text/x-python",166   "name": "python",167   "nbconvert_exporter": "python",168   "pygments_lexer": "ipython3",169   "version": "3.12.7"170  }171 },172 "nbformat": 4,173 "nbformat_minor": 5174}175