p1atdev/ja-stackoverflow
ja-stackoverflow 日本語版 Stack Overflow の スタック・オーバーフロー のデータダンプ をもとにデータを加工し、質問文と回答文のペアになるように調整した QA データセット。 データ構造 投稿本文は html2text を使ってマークダウン化されています。その際、 コードブロックは ``` で囲まれるように変更されています。 画像 URL に base64 エンコードされた画像が含まれる場合、 [unk] に置き換えています。 default サブセット id: 質問投稿の ID question: 質問投稿 answers: 質問に対する回答投稿のリスト accepted_answer_id: 質問者に選ばれた回答のID。null の可能性がある popular_answer_id: もっともスコアが高かった回答のID。null の可能性がある simple サブセット default サブセットから、 question… See the full description on the dataset page: https://huggingface.co/datasets/p1atdev/ja-stackoverflow.
864
1---2dataset_info:3- config_name: default4 features:5 - name: question6 struct:7 - name: accepted_answer_id8 dtype: string9 - name: answer_count10 dtype: int6411 - name: body12 dtype: string13 - name: comment_count14 dtype: int6415 - name: content_license16 dtype: string17 - name: creation_date18 dtype: string19 - name: favorite_count20 dtype: int6421 - name: id22 dtype: string23 - name: last_activity_date24 dtype: string25 - name: last_edit_date26 dtype: string27 - name: last_editor_user_id28 dtype: string29 - name: owner_user_id30 dtype: string31 - name: post_type32 dtype: string33 - name: score34 dtype: int6435 - name: tags36 sequence: string37 - name: title38 dtype: string39 - name: view_count40 dtype: int6441 - name: answers42 list:43 - name: body44 dtype: string45 - name: comment_count46 dtype: int6447 - name: content_license48 dtype: string49 - name: creation_date50 dtype: string51 - name: id52 dtype: string53 - name: last_activity_date54 dtype: string55 - name: last_edit_date56 dtype: string57 - name: last_editor_user_id58 dtype: string59 - name: owner_user_id60 dtype: string61 - name: parent_id62 dtype: string63 - name: post_type64 dtype: string65 - name: score66 dtype: int6467 - name: id68 dtype: string69 - name: accepted_answer_id70 dtype: string71 - name: popular_answer_id72 dtype: string73 splits:74 - name: train75 num_bytes: 11259655476 num_examples: 3055177 download_size: 5480553078 dataset_size: 11259655479- config_name: simple80 features:81 - name: id82 dtype: string83 - name: accepted_answer_id84 dtype: string85 - name: popular_answer_id86 dtype: string87 - name: title88 dtype: string89 - name: question_body90 dtype: string91 - name: question_score92 dtype: int6493 - name: accepted_answer_body94 dtype: string95 - name: accepted_answer_score96 dtype: int6497 - name: popular_answer_body98 dtype: string99 - name: popular_answer_score100 dtype: int64101 - name: tags102 sequence: string103 splits:104 - name: train105 num_bytes: 113051344106 num_examples: 30551107 download_size: 56632072108 dataset_size: 113051344109configs:110- config_name: default111 data_files:112 - split: train113 path: data/train-*114- config_name: simple115 data_files:116 - split: train117 path: simple/train-*118license: cc-by-sa-4.0119task_categories:120- text-generation121- question-answering122language:123- ja124tags:125- stackoverflow126- programming127pretty_name: Japanese StackOverflow128size_categories:129- 10K<n<100K130---131 132# ja-stackoverflow133 134日本語版 Stack Overflow の [スタック・オーバーフロー](https://ja.stackoverflow.com/) の[データダンプ](https://archive.org/download/stackexchange) をもとにデータを加工し、質問文と回答文のペアになるように調整した QA データセット。135 136## データ構造137 138投稿本文は `html2text` を使ってマークダウン化されています。その際、139 140- コードブロックは \`\`\` で囲まれるように変更されています。141- 画像 URL に base64 エンコードされた画像が含まれる場合、 `[unk]` に置き換えています。142 143### `default` サブセット144 145- `id`: 質問投稿の ID146- `question`: 質問投稿147- `answers`: 質問に対する回答投稿のリスト148- `accepted_answer_id`: 質問者に選ばれた回答のID。`null` の可能性がある149- `popular_answer_id`: もっともスコアが高かった回答のID。`null` の可能性がある150 151 152### `simple` サブセット 153 154`default` サブセットから、 `question` と `answers` の辞書を展開しシンプルにしたもの。155 156- `id`: 質問投稿の ID157- `accepted_answer_id`: 質問者に選ばれた回答のID。`null` の可能性がある158- `popular_answer_id`: もっともスコアが高かった回答のID。`null` の可能性がある159- `title`: 質問のタイトル160- `question_body`: 質問本文161- `question_score`: 質問のスコア162- `tags`: 質問に関連付けられたタグ163- `accepted_answer_body`: 質問者に選ばれた回答の本文。`null` の可能性がある164- `accepted_answer_score`: 質問者に選ばれた回答のスコア。`null` の可能性がある165- `popular_answer_body`: もっともスコアが高かった回答の本文。`null` の可能性がある166- `popular_answer_score`: もっともスコアが高かった回答のスコア。`null` の可能性がある167 168## 使い方169 170datasets ライブラリを用いて簡単に利用できます。171 172```py173from datasets import load_dataset174 175dataset = load_dataset("p1atdev/ja-stackoverflow", name="simple" split="train")176 177print(dataset)178#Dataset({179# features: ['id', 'accepted_answer_id', 'popular_answer_id', 'title', 'question_body', 'question_score', 'accepted_answer_body', 'accepted_answer_score', 'popular_answer_body', 'popular_answer_score', 'tags'],180# num_rows: 30551181#})182```183 184 185 186## ライセンス187 188StackOverflow に基づき、[CC BY-SA 4.0](https://creativecommons.org/licenses/by-sa/4.0/deed.ja)189 