Team Ai
Datasetpublic

jmp1987/simson-unified-knowledge-graph

🧠 Simson Unified Knowledge Graph 173 Nodes × 348 Edges – der Klebstoff zwischen allen Simson-Datasets. Was das ist Ein maschinenlesbarer Graph, der alle 6 Datasets miteinander verknüpft: Dataset Status Nodes racing-planet-simson-traces Diagnose-Traces 15 simson-forum-qa-pairs Forum-Wissen 30 simson-repair-manual Technische Daten 14 racing-planet-product-catalog Teilekatalog 37 simson-youtube-tutorials Video-Tutorials 20… See the full description on the dataset page: https://huggingface.co/datasets/jmp1987/simson-unified-knowledge-graph.

sourceHugging Facecc-by-4.0updated 4mo agoView on Hugging Face
0likes10downloads
Dataset Card

🧠 Simson Unified Knowledge Graph

173 Nodes × 348 Edges – der Klebstoff zwischen allen Simson-Datasets.

Was das ist

Ein maschinenlesbarer Graph, der alle 6 Datasets miteinander verknüpft:

DatasetStatusNodes
racing-planet-simson-tracesDiagnose-Traces15
simson-forum-qa-pairsForum-Wissen30
simson-repair-manualTechnische Daten14
racing-planet-product-catalogTeilekatalog37
simson-youtube-tutorialsVideo-Tutorials20
simson-part-problem-matrixDiagnose-Logik57

Edge-Typen

RelationAnzahlBedeutung
similar_to228Forum-Threads mit gleichem Topic
has_cause44Symptom → Ursache
fixed_by_part38Ursache → Produkt
fixes_with35Symptom → direktes Produkt
references3Forum → Handbuch
demonstrates(weitere)YouTube → Handbuch

Verwendung

python
from datasets import load_dataset
import json

ds = load_dataset("jmp1987/simson-unified-knowledge-graph")
graph = json.loads(ds["train"][0]["nodes"])
edges = json.loads(ds["train"][0]["edges"])

# Finde alle Teile für ein Symptom
symptom_node = next(n for n in graph if n["label"].startswith("Motor springt"))
related = [e for e in edges if e["source"] == symptom_node["id"]]

RAG-Integration

Der Knowledge Graph erlaubt:

  1. 1.Hop-1 Retrieval: Frage → Symptom-Node → verlinkte Produkte/Manual/Forum
  2. 2.Hop-2 Retrieval: Frage → Symptom → Ursache → nötige Teile → Assembly-Deps
  3. 3.Cross-Dataset Retrieval: Automatisches Finden relevanter Chunks aus allen Datasets