Team Ai
Datasetpublic

fassabilf/diffusion-mcqa-gen-pelatnas-2026

Which Prompt Made This? — Generated Edition Pelatnas IOAI 2026 · Task Diffusion MCQA (varian trajectory) Sebuah model text-to-image sedang bekerja. Di tengah prosesnya, gambar belum menjadi gambar — yang ada hanya latent ter-noise: tensor 4 × 64 × 64 berisi campuran struktur yang mulai muncul dan derau Gaussian. Kali ini kalimat itu harfiah. Latent yang kamu terima benar-benar diambil dari tengah proses generate: sebuah trajectory denoising DDIM 50 langkah dihentikan sejenak… See the full description on the dataset page: https://huggingface.co/datasets/fassabilf/diffusion-mcqa-gen-pelatnas-2026.

sourceHugging Facecc-by-4.0updated 2mo agoView on Hugging Face
0likes150downloads
Dataset Card

Which Prompt Made This? — Generated Edition

Pelatnas IOAI 2026 · Task Diffusion MCQA (varian trajectory)

Sebuah model text-to-image sedang bekerja. Di tengah prosesnya, gambar belum menjadi gambar — yang ada hanya latent ter-noise: tensor 4 × 64 × 64 berisi campuran struktur yang mulai muncul dan derau Gaussian.

Kali ini kalimat itu harfiah. Latent yang kamu terima benar-benar diambil dari tengah proses generate: sebuah trajectory denoising DDIM 50 langkah dihentikan sejenak pada timestep t, dan isinya disalin apa adanya. Bukan foto yang diberi noise — melainkan gambar yang sedang dalam perjalanan untuk menjadi ada.

Untuk tiap state kamu tahu berapa banyak noise yang masih tersisa (timestep t), dan kamu diberi 5 kandidat caption. Tepat satu adalah prompt yang melahirkannya.

Tentukan yang mana.

MetrikAccuracy
Chance20%
Baseline yang disediakan≈53%
Test250 soal
Train100 soal berlabel
ModelCompVis/stable-diffusion-v1-4 (boleh dipakai seluruhnya)
Waktu~100 menit · Colab T4

Mulai dari sini

Buka `baseline_notebook.ipynb` di Colab (aktifkan GPU T4). Notebook itu berjalan dari nol sampai menghasilkan submission.csv yang valid, dalam beberapa menit.

python
from huggingface_hub import snapshot_download
DATA = snapshot_download(repo_id="fassabilf/diffusion-mcqa-gen-pelatnas-2026",
                         repo_type="dataset")

Isi

train/train.csv          100 baris — id, t, type, choice_0..4, label
train/latents/{id}.npy   (4,64,64) float16
test/test.csv            250 baris — id, t, choice_0..4
test/latents/{id}.npy    (4,64,64) float16
sample_submission.csv    id, label
pages/                   description · evaluation · data · rules

⚠️ Dua hal teknis yang perlu kamu tahu di depan

1. Skala. Latent .npy sudah dikalikan faktor skala VAE `0.18215` — siap langsung masuk UNet, tanpa penyesuaian. Untuk VAE decode, bagi dulu:

python
eps = unet(lat, t, encoder_hidden_states=cond).sample   # langsung
img = vae.decode(lat / 0.18215).sample                  # bagi dulu

2. Nilai `t` tidak bulat. Kamu akan melihat t = 41, 401, 701 — bukan 50, 400,

  1. 1.Itu bukan salah ketik. DDIM 50 langkah hanya melewati timestep {981, 961, ..., 41, 21, 1}, dan latent ini diambil pada langkah yang benar-benar dilewati. Pakai nilai t dari CSV apa adanya saat menghitung ᾱ_t; membulatkannya akan membuat aritmetika kamu meleset.

Selengkapnya di `pages/data.md`. Baca itu sebelum menulis kode — sisanya adalah soalnya.

Halaman

  • —`pages/description.md` — deskripsi task
  • —`pages/data.md` — format data, skema kolom, cara data dibuat
  • —`pages/evaluation.md` — metrik, format submission, cara membaca Public/Private
  • —`pages/rules.md` — yang boleh dan tidak boleh

Sumber

Seluruh gambar dihasilkan oleh Stable Diffusion v1.4 dari caption berbahasa Inggris; tidak ada foto nyata di dalam dataset ini. ε, x_0, dan seed tidak pernah dirilis — yang tersimpan hanya x_t.