FronyAI/ko-multisource-retrieval-dataset
구성 여러 공개 출처를 하나의 스키마로 통합한 한국어 query–passage 페어 데이터셋입니다. stage1, stage2 두 subset. 각각 train 100,000 / valid 10,000행 (총 220,000행, parquet, 151MB) 필드 설명 dataset 원 출처 식별자 (18종) query 질의문 (2~2,020자) passage 대응 문서 (10~2,050자) 출처 AI 허브 — 기계독해 지식검색 일반상식 도서자료 행정문서 뉴스기사 금융법률 숫자연산 표정보 추상요약 이벤트 (AI허브_ 접두사) KLUE — klue-mrc klue-nli klue-sts 기타 — kakao-nli 공공데이터포털-deepqa LGNLP 참고 출처별로 페어 성격이 다르므로 용도에 맞게 필터링을 권장합니다. klue-nli klue-sts… See the full description on the dataset page: https://huggingface.co/datasets/FronyAI/ko-multisource-retrieval-dataset.
020
구성
- 여러 공개 출처를 하나의 스키마로 통합한 한국어 query–passage 페어 데이터셋입니다.
stage1,stage2두 subset. 각각 train 100,000 / valid 10,000행 (총 220,000행, parquet, 151MB)
출처
- AI 허브 —
기계독해지식검색일반상식도서자료행정문서뉴스기사금융법률숫자연산표정보추상요약이벤트(AI허브_접두사) - KLUE —
klue-mrcklue-nliklue-sts - 기타 —
kakao-nli공공데이터포털-deepqaLGNLP
참고
출처별로 페어 성격이 다르므로 용도에 맞게 필터링을 권장합니다.
klue-nliklue-stskakao-nli— NLI/STS 유래. 짧은 문장 ↔ 짧은 문장AI허브_추상요약—query가 원문,passage가 요약문으로 길이 방향이 반대AI허브_표정보LGNLP— passage에 마크다운 표 포함
from datasets import load_dataset
ds = load_dataset("FronyAI/ko-multisource-retrieval-dataset", "stage1")
mrc = ds["train"].filter(lambda x: x["dataset"] == "AI허브_기계독해")라이선스
출처별 원 라이선스가 그대로 적용됩니다.
- AI 허브 — 과학기술정보통신부·한국지능정보사회진흥원 「지능정보산업 인프라 조성」 사업 결과물. 이용 시 출처 표기 필요하며 2차적 저작물에도 동일 적용. 이용정책
- KLUE — CC BY-SA 4.0 (동일조건변경허락)
