Team Ai
Datasetpublic

QuantBlockchain/qcv-dataset

QCV-Dataset 132 Quantum Circuits · 5 Core Modalities · 792 Experiment Results · Bilingual Annotations The first multimodal quantum circuit dataset for training and evaluating AI systems on quantum circuit understanding, code generation, and verification. Dataset Summary QCV-Dataset contains 132 quantum circuits across 13 categories, each with 5 core modalities: circuit diagram image, Amazon Braket SDK code, Qiskit code, simulation results (state vectors), and… See the full description on the dataset page: https://huggingface.co/datasets/QuantBlockchain/qcv-dataset.

sourceHugging Facemitupdated 4mo agoView on Hugging Face
0likes50downloads
Dataset Card

QCV-Dataset

132 Quantum Circuits · 5 Core Modalities · 792 Experiment Results · Bilingual Annotations

The first multimodal quantum circuit dataset for training and evaluating AI systems on quantum circuit understanding, code generation, and verification.

Dataset Description

  • —Curated by: Dongping Liu, Aoyu Zhang, Luyao Zhang
  • —Language(s): English (EN), Chinese (CN) — bilingual annotations
  • —License: MIT
  • —Modality: Multimodal — Images (circuit diagrams), Text (code + descriptions), Numerical (state vectors)

Dataset Summary

QCV-Dataset contains 132 quantum circuits across 13 categories, each with 5 core modalities: circuit diagram image, Amazon Braket SDK code, Qiskit code, simulation results (state vectors), and bilingual expert annotations. Additionally, 792 experimental model invocations (3 models × 2 prompting modes × 132 circuits) provide a comprehensive benchmark for evaluating visual AI agents on quantum code generation.

Dataset Structure

Config: circuits (default)

FeatureTypeDescription
idstringUnique circuit identifier (e.g., C01_deutsch_jozsa_3)
circuit_imageImageQiskit-generated circuit diagram (PNG, 150 DPI, IQP style)
braket_codestringAmazon Braket SDK executable Python code
qiskit_codestringQiskit equivalent implementation
description_enstringEnglish algorithm description
description_cnstringChinese algorithm description
categorystringCircuit category (13 categories)
difficultystringDifficulty level: basic, intermediate, advanced
qubitsint32Number of qubits (1–10)
gate_countint32Number of gates (or null)
depthint32Circuit depth (1–27)
blockchain_relevancestringBlockchain relevance tag (if applicable)
state_vector_dimint32Dimension of state vector (2^qubits)
nonzero_amplitudesint32Number of nonzero amplitudes
state_vector_realsequence[float64]Real components of simulated state vector
state_vector_imagsequence[float64]Imaginary components of simulated state vector
target_descriptionstringTarget task description
best_pass_ratestringBest pass rate across all models (e.g., "5/6")
all_passboolWhether circuit passed all model-mode combinations
all_failboolWhether circuit failed all model-mode combinations

Config: experiments

FeatureTypeDescription
circuit_idstringReference to circuit
modelstringModel name (claude-opus-4.6, claude-sonnet-4.6, claude-haiku-4.5)
modestringPrompting mode (bv = base vision, tv = thinking vision / chain-of-thought)
syntax_okboolWhether generated code compiles
exec_okboolWhether code executes without runtime errors
fidelityfloat64Unitary matrix fidelity score
passboolWhether verification passed (fidelity >= 0.99)
errorstringError message (if failed)

Config: failures

Annotated failure cases from model evaluation with error type classification.

Config: equivalences

Circuit equivalence pairs for verification benchmarking.

Categories (13)

IDCategoryCountQubits
demoBasic Gates51–3
interIntermediate102–4
advAdvanced Algorithms63–5
blockchainBlockchain Protocols112–8
AGate Type Coverage151–3
BQubit Scaling124–10
CClassical Algorithms152–4
DVariational/Parameterized102–4
EError Correction83–9
FQuantum ML102–8
GBlockchain Extended83–6
HVisual Variants102–4
IBTC/Blockchain Security124–7

Dataset Creation

Data Collection

  • —Circuit diagrams generated with Qiskit QuantumCircuit.draw("mpl", style="iqp") at 150 DPI with tight bounding boxes
  • —Ground-truth code implemented in Amazon Braket SDK
  • —All circuits verified executable on Amazon Braket LocalSimulator

Annotations

  • —Bilingual descriptions (EN/CN) created by domain experts
  • —Categories assigned based on algorithm type and complexity
  • —Difficulty levels determined by circuit depth and gate complexity

Experiment Results

ModelBV Pass%TV Pass%Credits/Correct
Claude Opus 4.678%75%0.778
Claude Sonnet 4.677%75%0.142
Claude Haiku 4.543%46%0.072

Key Findings:

  • —45 circuits passed all 6 model-mode combinations
  • —18 circuits failed all 6 combinations
  • —Structural complexity (not qubit count) determines success
  • —Chain-of-thought provides no benefit for strong models (delta = -3 to -4%) but modest improvement for weakest (delta = +5%)

Usage

Load the dataset

python
from datasets import load_dataset

# Load main circuits dataset
circuits = load_dataset("QuantBlockchain/qcv-dataset", "circuits", split="train")

# Load experiment results
experiments = load_dataset("QuantBlockchain/qcv-dataset", "experiments", split="train")

# Access a sample
sample = circuits[0]
print(sample["id"])              # C01_deutsch_jozsa_3
print(sample["circuit_image"])    # PIL.Image object
print(sample["braket_code"])      # Python code string
print(sample["description_en"])   # English description
print(sample["description_cn"])   # Chinese description

Filter by category

python
algo_circuits = circuits.filter(lambda x: x["category"] == "classical_algorithms")
small_circuits = circuits.filter(lambda x: x["qubits"] <= 3)
passing_circuits = circuits.filter(lambda x: x["all_pass"] == True)

Analyze experiment results

python
from collections import Counter

model_pass = {}
for exp in experiments:
    model = exp["model"]
    if model not in model_pass:
        model_pass[model] = {"total": 0, "passed": 0}
    model_pass[model]["total"] += 1
    if exp["pass"]:
        model_pass[model]["passed"] += 1

for model, stats in model_pass.items():
    rate = stats["passed"] / stats["total"] * 100
    print(f"{model}: {rate:.1f}% ({stats['passed']}/{stats['total']})")

Data Governance & Croissant

This dataset follows Croissant metadata standards for machine-readable dataset descriptions. The dataset card uses structured YAML front matter for discoverability and includes:

  • —Data provenance: Synthetic generation via Qiskit + expert curation
  • —Annotation methodology: Expert-generated bilingual descriptions
  • —Verification protocol: Unitary matrix fidelity >= 0.99 on Braket LocalSimulator
  • —Known limitations: Framework-specific (Braket SDK), simulation-only, EN/CN bilingual only
  • —Bias considerations: 23.5% blockchain-relevant circuits may skew toward cryptographic applications

The dataset also includes a Croissant-RAI (croissant-rai.jsonld) extension documenting responsible AI considerations, data limitations, and recommended use cases.

Limitations and Biases

LimitationDescription
Framework lock-inCode is Amazon Braket SDK specific
Simulation gapNo hardware execution data; LocalSimulator results may differ from real QPUs
Language coverageBilingual EN/CN only
Depth range1-27; may not represent extremely deep circuits
Domain skew23.5% blockchain-relevant circuits over-represents cryptographic applications

Citation

bibtex
@misc{liu2026qcv,
  title={QCV: Cost-Aware Evaluation of Visual AI Agents for Quantum Code Generation},
  author={Liu, Dongping and Zhang, Aoyu and Zhang, Luyao},
  year={2026},
  url={https://github.com/QuantBlockchain/quantum-circuit-vision}
}

License

MIT — see LICENSE

Additional Documentation