Team Ai
Datasetpublic

fassabilf/diffusion-mcqa-pelatnas-2026

Which Prompt Made This? Pelatnas IOAI 2026 · Task Diffusion MCQA Sebuah model text-to-image sedang bekerja. Di tengah prosesnya, gambar belum menjadi gambar — yang ada hanya latent ter-noise: tensor 4 × 64 × 64 berisi campuran sisa struktur gambar dan derau Gaussian. Kami menangkap 250 state seperti itu. Untuk tiap state kamu tahu berapa banyak noise yang sudah ditambahkan (timestep t), dan kamu diberi 5 kandidat caption. Tepat satu adalah deskripsi asli gambarnya. Tentukan yang… See the full description on the dataset page: https://huggingface.co/datasets/fassabilf/diffusion-mcqa-pelatnas-2026.

sourceHugging Facecc-by-4.0updated 2mo agoView on Hugging Face
0likes84downloads
Dataset Card

Which Prompt Made This?

Pelatnas IOAI 2026 · Task Diffusion MCQA

Sebuah model text-to-image sedang bekerja. Di tengah prosesnya, gambar belum menjadi gambar — yang ada hanya latent ter-noise: tensor 4 × 64 × 64 berisi campuran sisa struktur gambar dan derau Gaussian.

Kami menangkap 250 state seperti itu. Untuk tiap state kamu tahu berapa banyak noise yang sudah ditambahkan (timestep t), dan kamu diberi 5 kandidat caption. Tepat satu adalah deskripsi asli gambarnya.

Tentukan yang mana.

MetrikAccuracy
Chance20%
Baseline yang disediakan≈41%
Test250 soal
Train100 soal berlabel
ModelCompVis/stable-diffusion-v1-4 (boleh dipakai seluruhnya)
Waktu~100 menit · Colab T4

Mulai dari sini

Buka `baseline_notebook.ipynb` di Colab (aktifkan GPU T4). Notebook itu berjalan dari nol sampai menghasilkan submission.csv yang valid, dalam beberapa menit.

python
from huggingface_hub import snapshot_download
DATA = snapshot_download(repo_id="fassabilf/diffusion-mcqa-pelatnas-2026",
                         repo_type="dataset")

Isi

train/train.csv          100 baris — id, t, type, choice_0..4, label
train/latents/{id}.npy   (4,64,64) float16
test/test.csv            250 baris — id, t, choice_0..4
test/latents/{id}.npy    (4,64,64) float16
sample_submission.csv    id, label
pages/                   description · evaluation · data · rules

⚠️ Satu hal teknis yang perlu kamu tahu di depan

Latent .npy sudah dikalikan faktor skala VAE `0.18215` — siap langsung masuk UNet, tanpa penyesuaian. Untuk VAE decode, bagi dulu:

python
eps = unet(lat, t, encoder_hidden_states=cond).sample   # langsung
img = vae.decode(lat / 0.18215).sample                  # bagi dulu

Selengkapnya di `pages/data.md`. Baca itu sebelum menulis kode — sisanya adalah soalnya.

Halaman

  • —`pages/description.md` — deskripsi task
  • —`pages/data.md` — format data, skema kolom, cara data dibuat
  • —`pages/evaluation.md` — metrik, format submission, cara membaca Public/Private
  • —`pages/rules.md` — yang boleh dan tidak boleh

Sumber

Gambar berasal dari foto publik berlisensi, di-encode dengan VAE Stable Diffusion v1.4 lalu diberi noise mengikuti forward process standar. ε, x_0, dan seed tidak pernah dirilis.