Team Ai
Modelpublic

cisimcik/cisimcik-base

sourceHugging Faceapache-2.0updated 6d agoView on Hugging Face
0likes689downloads
Model Card

<p align="center"> <img src="https://huggingface.co/cisimcik/cisimcik-base/resolve/main/cisimcik-base-logo.svg" alt="cisimcik-base" width="580" class="dark:hidden mx-auto"> <img src="https://huggingface.co/cisimcik/cisimcik-base/resolve/main/cisimcik-base-logo-dark.svg" alt="cisimcik-base" width="580" class="hidden dark:block mx-auto"> </p>

<p align="center"> <a href="https://huggingface.co/cisimcik/cisimcik-base/blob/main/README_en.md"><img src="https://img.shields.io/badge/English-6b7280?style=for-the-badge" alt="English"></a> <a href="https://huggingface.co/cisimcik/cisimcik-base"><img src="https://img.shields.io/badge/T%C3%BCrk%C3%A7e-2563eb?style=for-the-badge" alt="Türkçe"></a> </p>

cisimcik-base

cisimcik-base, Türkçe öncelikli bir temel (base) dil modelidir (base model). Qwen/Qwen3.5-4B-Base modelinin, çoğunlukla Türkçe metinle devam ön eğitiminden (continued pre-training) eğitilmiş halidir.

  • —4,2 milyar parametre. Qwen3.5 hibrit mimarisi (Gated DeltaNet + full attention), yalnızca metin.
  • —10B token training. %91,5 Türkçe, %8,5 replay (İngilizce, kod, matematik, 23 başka dil).
  • —Apache 2.0 lisansıyla açık kaynak olarak yayınlandı.

Hızlı başlangıç

bash
pip install "transformers>=5.17" torch
# isteğe bağlı, NVIDIA GPU'larda daha hızlı Gated DeltaNet kernel'leri:
pip install flash-linear-attention
python
import torch
from transformers import AutoModelForCausalLM, AutoTokenizer

tok = AutoTokenizer.from_pretrained("cisimcik/cisimcik-base")
model = AutoModelForCausalLM.from_pretrained("cisimcik/cisimcik-base", dtype=torch.bfloat16)
model = model.to("cuda" if torch.cuda.is_available() else "cpu").eval()

inputs = tok("Kapadokya'daki peri bacaları,", return_tensors="pt").to(model.device)
out = model.generate(**inputs, max_new_tokens=150, do_sample=True, temperature=0.7, top_p=0.9)
print(tok.decode(out[0], skip_special_tokens=True))

Bu bir temel modeldir. Sadece verilen prompt'u tamamlar, sohbet etmez. Sohbet için cisimcik-4b kullanın.

Donanım. Ağırlıklar bf16'da yaklaşık 8,4 GB: 12 GB veya üzeri belleğe sahip herhangi bir GPU ya da 16 GB RAM'li bir CPU yeterlidir. flash-linear-attention kurulu değilse Gated DeltaNet katmanları transformers'ın PyTorch uygulamasını kullanır. Bu doğru sonuç verir ama uzun girdilerde daha yavaştır.

Görev kıyaslamalarına bu model üzerine eğitilen modellerden ulaşılabilir: cisimcik-4b (CETVEL, OpenLLM Turkish Leaderboard) ve tau-4b.

Mimari

ParçaAyrıntı
ModelQwen3.5-4B metin modeli (Qwen3_5ForCausalLM): 32 katman, hidden size 2560, MLP 9216. Her 4. katman full attention (16 query / 4 KV head, head dim 256), diğer 24'ü Gated DeltaNet linear attention.
Dictionary248.320, Qwen3.5 tokenizer'ı değiştirilmeden. Tied embedding'ler.
Temel modelden çıkarılanlargörüntü kodlayıcı (vision encoder) ve çoklu token tahmini (MTP) katmanı
Parametre4,21 milyar
Context16.384 token'a kadar dizilerle eğitildi. Pozisyonlar 262.144'e kadar gider (temel modelden)

Dosyalar

Dosyaİçerik
model-0000*-of-00002.safetensorsağırlıklar (bf16)
config.jsonQwen3_5ForCausalLM config'i
tokenizer*.json, vocab.json, merges.txtQwen3.5 tokenizer'ı, değiştirilmeden

Lisans

Bu depodaki ağırlıklar Apache License 2.0 ile yayımlanmıştır (bkz. LICENSE ve NOTICE). Model, Qwen/Qwen3.5-4B-Base © 2026 Alibaba Cloud, Apache License 2.0 lisanslı modelin değiştirilmiş bir sürümüdür. Temel model Qwen/Qwen3.5-4B-Base'dir.

Atıf

bibtex
@misc{cisimcikbase2026,
  title  = {cisimcik-base: a Turkish-first base language model},
  author = {cisimcik},
  year   = {2026},
  url    = {https://huggingface.co/cisimcik/cisimcik-base}
}