ysn-rfd/text-dataset-tiny-code-script-py-format
USED of tahamajs/medicine_ds_persian for .parquet file USED of Alijafarixcs2/persian-it-llama2-2k for .parquet file USED of Abirate/english_quotes for .jsonl file NEW FILES (05/12/2025) NEW FILES (12/26/2025) NEW FILES (02/15/2026)
31.7k
1{2 "cells": [3 {4 "cell_type": "code",5 "execution_count": 1,6 "id": "1dabd320-903a-4f6c-9634-e8bd5993f90f",7 "metadata": {},8 "outputs": [9 {10 "name": "stdout",11 "output_type": "stream",12 "text": [13 "* Running on local URL: http://127.0.0.1:7860\n",14 "* To create a public link, set `share=True` in `launch()`.\n"15 ]16 },17 {18 "data": {19 "text/html": [20 "<div><iframe src=\"http://127.0.0.1:7860/\" width=\"100%\" height=\"500\" allow=\"autoplay; camera; microphone; clipboard-read; clipboard-write;\" frameborder=\"0\" allowfullscreen></iframe></div>"21 ],22 "text/plain": [23 "<IPython.core.display.HTML object>"24 ]25 },26 "metadata": {},27 "output_type": "display_data"28 },29 {30 "data": {31 "text/plain": []32 },33 "execution_count": 1,34 "metadata": {},35 "output_type": "execute_result"36 }37 ],38 "source": [39 "from transformers import AutoModelForCausalLM, AutoTokenizer\n",40 "import torch\n",41 "import gradio as gr\n",42 "\n",43 "# مدل و توکنایزر\n",44 "model_name = \"HuggingFaceTB/SmolLM2-360M-Instruct\"\n",45 "tokenizer = AutoTokenizer.from_pretrained(model_name)\n",46 "model = AutoModelForCausalLM.from_pretrained(model_name)\n",47 "device = torch.device(\"cuda\" if torch.cuda.is_available() else \"cpu\")\n",48 "model.to(device)\n",49 "model.eval()\n",50 "\n",51 "# پیامهای اولیه مکالمه\n",52 "def format_messages(user_prompt):\n",53 " system_message = \"<|im_start|>system\\n<|im_end|>\\n\"\n",54 " user_message = f\"<|im_start|>user\\n{user_prompt}<|im_end|>\\n\"\n",55 " assistant_prefix = \"<|im_start|>assistant\\n\"\n",56 " full_prompt = system_message + user_message + assistant_prefix\n",57 " return full_prompt\n",58 "\n",59 "# تابع چت\n",60 "def chat(user_input):\n",61 " prompt = format_messages(user_input)\n",62 " inputs = tokenizer(prompt, return_tensors=\"pt\").to(device)\n",63 "\n",64 " with torch.no_grad():\n",65 " outputs = model.generate(\n",66 " **inputs,\n",67 " max_new_tokens=256,\n",68 " do_sample=True,\n",69 " temperature=0.7,\n",70 " top_p=0.9,\n",71 " pad_token_id=tokenizer.eos_token_id\n",72 " )\n",73 "\n",74 " response = tokenizer.decode(outputs[0], skip_special_tokens=True)\n",75 " \n",76 " # پاسخ مدل بعد از آخرین <|im_start|>assistant\n",77 " if \"<|im_start|>assistant\" in response:\n",78 " response = response.split(\"<|im_start|>assistant\")[-1].strip()\n",79 " if \"<|im_end|>\" in response:\n",80 " response = response.split(\"<|im_end|>\")[0].strip()\n",81 " \n",82 " return response\n",83 "\n",84 "# رابط گرافیکی Gradio\n",85 "interface = gr.Interface(\n",86 " fn=chat,\n",87 " inputs=gr.Textbox(lines=3, placeholder=\"پیام خود را وارد کنید...\"),\n",88 " outputs=\"text\",\n",89 " title=\"💬 SmolLM2 Chatbot\",\n",90 " description=\"مدل سبک و مکالمهمحور SmolLM2 از Hugging Face با فرمت قالب رسمی\"\n",91 ")\n",92 "\n",93 "interface.launch()\n"94 ]95 },96 {97 "cell_type": "code",98 "execution_count": null,99 "id": "0f00bd7a-f925-4970-aeb6-96f1dcbad3c8",100 "metadata": {},101 "outputs": [],102 "source": []103 }104 ],105 "metadata": {106 "kernelspec": {107 "display_name": "Python [conda env:base] *",108 "language": "python",109 "name": "conda-base-py"110 },111 "language_info": {112 "codemirror_mode": {113 "name": "ipython",114 "version": 3115 },116 "file_extension": ".py",117 "mimetype": "text/x-python",118 "name": "python",119 "nbconvert_exporter": "python",120 "pygments_lexer": "ipython3",121 "version": "3.12.7"122 }123 },124 "nbformat": 4,125 "nbformat_minor": 5126}127 