Team Ai
Datasetpublic

bilalabic/math-toolcall-tr-benchmark

math-toolcall-tr-benchmark bilalabic/gemma_4_math-toolcall-tr_lora LoRA adaptörünü temel Gemma-4 E4B modeliyle karşılaştıran benchmark sonuçları. Bu depo yalnızca değerlendirme çıktılarını içerir. Eğitim veri seti ayrı olarak bilalabic/math-toolcall-tr adresinde yayımlanmaktadır. Benchmark'lar Benchmark Örnek Ölçülen davranış Türkçe MMLU 250 Genel bilgi doğruluğu ve eğitim sonrası bilgi kaybı Matematik Tool-Call 150 Araç seçimi, çekimserlik ve çıktı… See the full description on the dataset page: https://huggingface.co/datasets/bilalabic/math-toolcall-tr-benchmark.

sourceHugging Faceapache-2.0updated 3mo agoView on Hugging Face
0likes18downloads
Dataset Card

math-toolcall-tr-benchmark

`bilalabic/gemma_4_math-toolcall-tr_lora` LoRA adaptörünü temel Gemma-4 E4B modeliyle karşılaştıran benchmark sonuçları.

Bu depo yalnızca değerlendirme çıktılarını içerir. Eğitim veri seti ayrı olarak `bilalabic/math-toolcall-tr` adresinde yayımlanmaktadır.

Benchmark'lar

BenchmarkÖrnekÖlçülen davranış
Türkçe MMLU250Genel bilgi doğruluğu ve eğitim sonrası bilgi kaybı
Matematik Tool-Call150Araç seçimi, çekimserlik ve çıktı formatı
GSM8K150Matematik muhakemesi ve gereksiz araç çağırma eğilimi

Sonuç özeti

BenchmarkMetrikBaseFine-tuneFark
Türkçe MMLUDoğruluk%75,20%68,00−7,20 puan
Matematik Tool-CallGenel doğruluk%56,67%59,33+2,66 puan
Matematik Tool-CallAraç seçimi%53,77%54,72+0,95 puan
Matematik Tool-CallÇekimserlik%63,64%70,45+6,81 puan
Matematik Tool-CallFormat geçerliliği%98,67%99,33+0,66 puan
GSM8KDoğruluk%66,00%73,33+7,33 puan
GSM8KGereksiz araç çağrısı (düşük daha iyi)%0,00%14,00+14,00 puan

Sonuçlar tek bir çalıştırmaya aittir; birden fazla seed ortalaması veya güven aralığı değildir.

Dosyalar ve yapılandırmalar

YapılandırmaDosyaSatırİçerik
summarydata/benchmark_ozet.csv7Üç benchmark'ın toplu metrikleri
detailsdata/benchmark_detay.csv1.100Örnek ve model bazında ham değerlendirme çıktıları
mmlu_sectionsdata/benchmark_mmlu_bolum.csv61Türkçe MMLU bölüm kırılımı
python
from datasets import load_dataset

summary = load_dataset(
    "bilalabic/math-toolcall-tr-benchmark",
    "summary",
    split="test",
)
details = load_dataset(
    "bilalabic/math-toolcall-tr-benchmark",
    "details",
    split="test",
)
mmlu_sections = load_dataset(
    "bilalabic/math-toolcall-tr-benchmark",
    "mmlu_sections",
    split="test",
)

Değerlendirme notları

  • —Tool-call testi, modelin eğitiminde kullanılan ilk 757 kayıttan sonra gelen ve eğitim sırasında görülmeyen örnek havuzundan senaryo dengeli seçilmiştir.
  • —GSM8K testi standart test bölümündeki İngilizce matematik problemlerini kullanır.
  • —MMLU bölüm kırılımlarının bazıları az sayıda örnek içerdiğinden bölüm yüzdeleri yüksek varyans gösterebilir.
  • —benchmark_detay.csv farklı benchmark türlerinin alanlarını tek tabloda birleştirir; belirli bir benchmark için kullanılmayan sütunlar boş bırakılır.

Yeniden üretim

Benchmark notebook'u: benchmark_base_vs_finetune.ipynb

Lisans

Apache-2.0. Temel model Gemma kullanım şartlarına, GSM8K ve Türkçe MMLU kaynakları kendi lisans ve kullanım koşullarına tabidir.