Team Ai
Datasetpublic

p1atdev/ja-stackoverflow

ja-stackoverflow 日本語版 Stack Overflow の スタック・オーバーフロー のデータダンプ をもとにデータを加工し、質問文と回答文のペアになるように調整した QA データセット。 データ構造 投稿本文は html2text を使ってマークダウン化されています。その際、 コードブロックは ``` で囲まれるように変更されています。 画像 URL に base64 エンコードされた画像が含まれる場合、 [unk] に置き換えています。 default サブセット id: 質問投稿の ID question: 質問投稿 answers: 質問に対する回答投稿のリスト accepted_answer_id: 質問者に選ばれた回答のID。null の可能性がある popular_answer_id: もっともスコアが高かった回答のID。null の可能性がある simple サブセット default サブセットから、 question… See the full description on the dataset page: https://huggingface.co/datasets/p1atdev/ja-stackoverflow.

sourceHugging Facecc-by-sa-4.0updated 3y agoView on Hugging Face
8likes64downloads
README.md189 linesDownload Raw Back to root
1---2dataset_info:3- config_name: default4  features:5  - name: question6    struct:7    - name: accepted_answer_id8      dtype: string9    - name: answer_count10      dtype: int6411    - name: body12      dtype: string13    - name: comment_count14      dtype: int6415    - name: content_license16      dtype: string17    - name: creation_date18      dtype: string19    - name: favorite_count20      dtype: int6421    - name: id22      dtype: string23    - name: last_activity_date24      dtype: string25    - name: last_edit_date26      dtype: string27    - name: last_editor_user_id28      dtype: string29    - name: owner_user_id30      dtype: string31    - name: post_type32      dtype: string33    - name: score34      dtype: int6435    - name: tags36      sequence: string37    - name: title38      dtype: string39    - name: view_count40      dtype: int6441  - name: answers42    list:43    - name: body44      dtype: string45    - name: comment_count46      dtype: int6447    - name: content_license48      dtype: string49    - name: creation_date50      dtype: string51    - name: id52      dtype: string53    - name: last_activity_date54      dtype: string55    - name: last_edit_date56      dtype: string57    - name: last_editor_user_id58      dtype: string59    - name: owner_user_id60      dtype: string61    - name: parent_id62      dtype: string63    - name: post_type64      dtype: string65    - name: score66      dtype: int6467  - name: id68    dtype: string69  - name: accepted_answer_id70    dtype: string71  - name: popular_answer_id72    dtype: string73  splits:74  - name: train75    num_bytes: 11259655476    num_examples: 3055177  download_size: 5480553078  dataset_size: 11259655479- config_name: simple80  features:81  - name: id82    dtype: string83  - name: accepted_answer_id84    dtype: string85  - name: popular_answer_id86    dtype: string87  - name: title88    dtype: string89  - name: question_body90    dtype: string91  - name: question_score92    dtype: int6493  - name: accepted_answer_body94    dtype: string95  - name: accepted_answer_score96    dtype: int6497  - name: popular_answer_body98    dtype: string99  - name: popular_answer_score100    dtype: int64101  - name: tags102    sequence: string103  splits:104  - name: train105    num_bytes: 113051344106    num_examples: 30551107  download_size: 56632072108  dataset_size: 113051344109configs:110- config_name: default111  data_files:112  - split: train113    path: data/train-*114- config_name: simple115  data_files:116  - split: train117    path: simple/train-*118license: cc-by-sa-4.0119task_categories:120- text-generation121- question-answering122language:123- ja124tags:125- stackoverflow126- programming127pretty_name: Japanese StackOverflow128size_categories:129- 10K<n<100K130---131 132# ja-stackoverflow133 134日本語版 Stack Overflow の [スタック・オーバーフロー](https://ja.stackoverflow.com/) の[データダンプ](https://archive.org/download/stackexchange) をもとにデータを加工し、質問文と回答文のペアになるように調整した QA データセット。135 136## データ構造137 138投稿本文は `html2text` を使ってマークダウン化されています。その際、139 140- コードブロックは \`\`\` で囲まれるように変更されています。141- 画像 URL に base64 エンコードされた画像が含まれる場合、 `[unk]` に置き換えています。142 143### `default` サブセット144 145- `id`: 質問投稿の ID146- `question`: 質問投稿147- `answers`: 質問に対する回答投稿のリスト148- `accepted_answer_id`: 質問者に選ばれた回答のID。`null` の可能性がある149- `popular_answer_id`: もっともスコアが高かった回答のID。`null` の可能性がある150 151 152### `simple` サブセット 153 154`default` サブセットから、 `question` と `answers` の辞書を展開しシンプルにしたもの。155 156- `id`: 質問投稿の ID157- `accepted_answer_id`: 質問者に選ばれた回答のID。`null` の可能性がある158- `popular_answer_id`: もっともスコアが高かった回答のID。`null` の可能性がある159- `title`: 質問のタイトル160- `question_body`: 質問本文161- `question_score`: 質問のスコア162- `tags`: 質問に関連付けられたタグ163- `accepted_answer_body`: 質問者に選ばれた回答の本文。`null` の可能性がある164- `accepted_answer_score`: 質問者に選ばれた回答のスコア。`null` の可能性がある165- `popular_answer_body`: もっともスコアが高かった回答の本文。`null` の可能性がある166- `popular_answer_score`: もっともスコアが高かった回答のスコア。`null` の可能性がある167 168## 使い方169 170datasets ライブラリを用いて簡単に利用できます。171 172```py173from datasets import load_dataset174 175dataset = load_dataset("p1atdev/ja-stackoverflow", name="simple" split="train")176 177print(dataset)178#Dataset({179#    features: ['id', 'accepted_answer_id', 'popular_answer_id', 'title', 'question_body', 'question_score', 'accepted_answer_body', 'accepted_answer_score', 'popular_answer_body', 'popular_answer_score', 'tags'],180#    num_rows: 30551181#})182```183 184 185 186## ライセンス187 188StackOverflow に基づき、[CC BY-SA 4.0](https://creativecommons.org/licenses/by-sa/4.0/deed.ja)189