fassabilf/diffusion-mcqa-gen-pelatnas-2026
Which Prompt Made This? — Generated Edition Pelatnas IOAI 2026 · Task Diffusion MCQA (varian trajectory) Sebuah model text-to-image sedang bekerja. Di tengah prosesnya, gambar belum menjadi gambar — yang ada hanya latent ter-noise: tensor 4 × 64 × 64 berisi campuran struktur yang mulai muncul dan derau Gaussian. Kali ini kalimat itu harfiah. Latent yang kamu terima benar-benar diambil dari tengah proses generate: sebuah trajectory denoising DDIM 50 langkah dihentikan sejenak… See the full description on the dataset page: https://huggingface.co/datasets/fassabilf/diffusion-mcqa-gen-pelatnas-2026.
Which Prompt Made This? — Generated Edition
Pelatnas IOAI 2026 · Task Diffusion MCQA (varian trajectory)
Sebuah model text-to-image sedang bekerja. Di tengah prosesnya, gambar belum menjadi gambar — yang ada hanya latent ter-noise: tensor 4 × 64 × 64 berisi campuran struktur yang mulai muncul dan derau Gaussian.
Kali ini kalimat itu harfiah. Latent yang kamu terima benar-benar diambil dari tengah proses generate: sebuah trajectory denoising DDIM 50 langkah dihentikan sejenak pada timestep t, dan isinya disalin apa adanya. Bukan foto yang diberi noise — melainkan gambar yang sedang dalam perjalanan untuk menjadi ada.
Untuk tiap state kamu tahu berapa banyak noise yang masih tersisa (timestep t), dan kamu diberi 5 kandidat caption. Tepat satu adalah prompt yang melahirkannya.
Tentukan yang mana.
Mulai dari sini
Buka `baseline_notebook.ipynb` di Colab (aktifkan GPU T4). Notebook itu berjalan dari nol sampai menghasilkan submission.csv yang valid, dalam beberapa menit.
from huggingface_hub import snapshot_download
DATA = snapshot_download(repo_id="fassabilf/diffusion-mcqa-gen-pelatnas-2026",
repo_type="dataset")Isi
train/train.csv 100 baris — id, t, type, choice_0..4, label
train/latents/{id}.npy (4,64,64) float16
test/test.csv 250 baris — id, t, choice_0..4
test/latents/{id}.npy (4,64,64) float16
sample_submission.csv id, label
pages/ description · evaluation · data · rules⚠️ Dua hal teknis yang perlu kamu tahu di depan
1. Skala. Latent .npy sudah dikalikan faktor skala VAE `0.18215` — siap langsung masuk UNet, tanpa penyesuaian. Untuk VAE decode, bagi dulu:
eps = unet(lat, t, encoder_hidden_states=cond).sample # langsung
img = vae.decode(lat / 0.18215).sample # bagi dulu2. Nilai `t` tidak bulat. Kamu akan melihat t = 41, 401, 701 — bukan 50, 400,
- Itu bukan salah ketik. DDIM 50 langkah hanya melewati timestep
{981, 961, ..., 41, 21, 1}, dan latent ini diambil pada langkah yang benar-benar dilewati. Pakai nilaitdari CSV apa adanya saat menghitungᾱ_t; membulatkannya akan membuat aritmetika kamu meleset.
Selengkapnya di `pages/data.md`. Baca itu sebelum menulis kode — sisanya adalah soalnya.
Halaman
- `pages/description.md` — deskripsi task
- `pages/data.md` — format data, skema kolom, cara data dibuat
- `pages/evaluation.md` — metrik, format submission, cara membaca Public/Private
- `pages/rules.md` — yang boleh dan tidak boleh
Sumber
Seluruh gambar dihasilkan oleh Stable Diffusion v1.4 dari caption berbahasa Inggris; tidak ada foto nyata di dalam dataset ini. ε, x_0, dan seed tidak pernah dirilis — yang tersimpan hanya x_t.
