Team Ai
Datasetpublic

Simon-Liu/tw-finance-function-call-reasoning

tw-finance-function-call-reasoning 台灣金融場景的繁體中文 function-calling + 推理鏈微調資料集。 欄位規格對齊 twinkle-ai/tw-function-call-reasoning-10k。 ⚠️ 使用限制:僅供研究,不得商業使用 本資料集以 CC BY-NC 4.0 授權釋出,僅供學術研究、模型能力探索與方法驗證之用。 請務必理解以下事項後再使用: 不得作商業用途。 包含但不限於:訓練用於對外營利的模型、包裝為付費產品或服務、 作為商業交付物的一部分。若有商業需求,請自行重新建置資料並取得合規來源。 這不是財務、稅務、法律或投資建議。 資料中的稅率、費率、法規門檻雖依 2026 年 (民國 115 年)台灣公開資訊整理,但可能已經過時或有誤。任何實際決策前, 請以主管機關公告為準(財政部、金管會、勞動部、衛福部、中央銀行、全國法規資料庫)。 內容為程式化合成,非真實考題逐字收錄。 題目由模板與參數取樣組合而成,… See the full description on the dataset page: https://huggingface.co/datasets/Simon-Liu/tw-finance-function-call-reasoning.

sourceHugging Facecc-by-nc-4.0updated 1mo agoView on Hugging Face
0likes43downloads
Dataset Card

tw-finance-function-call-reasoning

台灣金融場景的繁體中文 function-calling + 推理鏈微調資料集。 欄位規格對齊 `twinkle-ai/tw-function-call-reasoning-10k`。


⚠️ 使用限制:僅供研究,不得商業使用

本資料集以 CC BY-NC 4.0 授權釋出,僅供學術研究、模型能力探索與方法驗證之用。

請務必理解以下事項後再使用:

  1. 1.不得作商業用途。 包含但不限於:訓練用於對外營利的模型、包裝為付費產品或服務、 作為商業交付物的一部分。若有商業需求,請自行重新建置資料並取得合規來源。
  1. 1.這不是財務、稅務、法律或投資建議。 資料中的稅率、費率、法規門檻雖依 2026 年 (民國 115 年)台灣公開資訊整理,但可能已經過時或有誤。任何實際決策前, 請以主管機關公告為準(財政部、金管會、勞動部、衛福部、中央銀行、全國法規資料庫)。
  1. 1.內容為程式化合成,非真實考題逐字收錄。 題目由模板與參數取樣組合而成, 並非任何證照考試的原始試題。工具(function)的 schema 為虛構的 API 介面設計, 不對應任何真實可呼叫的服務。
  1. 1.不得用於自動化的金融決策或客戶服務,除非已由具備資格的專業人員完整審閱與驗證。
  1. 1.資料中的人名、金額、帳戶情境均為虛構,不含任何真實個人資料。
一句話總結:這是一份研究用的方法論展示資料集,不是可以直接上線的產品資產。

資料集概覽

項目內容
語言繁體中文(query_zhtw / think)+ 英文(query)
領域11 類台灣金融場景
工具數35 個 function schema
樣本數1,200(train 1,080 / test 120,比例 9:1)
額外challenge config:40 題驗收挑戰集(欄位不同,見下)
授權CC BY-NC 4.0(僅研究、非商業)

領域分佈

securities 台股交易|tax 稅務|pension 勞健保與退休金|banking 銀行存放款| funds 基金與 ETF|fx 外匯|bond 債券與利率|compliance 法令遵循| credit 信用與授信|planning 財務規劃|knowledge 金融知識查詢

欄位規格

與參考資料集完全一致的 7 個欄位:

欄位型別說明
idint64樣本編號
querystring英文指令
toolsstring可用函式清單(JSON 字串,含干擾項)
query_zhtwstring繁體中文指令(實際訓練用的 user turn)
thinkstring繁體中文推理鏈
answerstring期望的函式呼叫(JSON 字串)
messageslist[{role, content}]長度 3 的 system / user / assistant,可直接 SFT

messages[2] 的格式為 <think>...</think> 後接一至多個 <tool_call>...</tool_call>。

範例

json
{
  "id": 100004,
  "query_zhtw": "同一家華南銀行放 6620000 元台幣加 3750000 元外幣,中央存保賠付上限是多少?同時,請算信用卡循環信用利息,未清償餘額 140000、年利率 14.82%、期間 90 天。",
  "answer": "[{\"name\": \"deposit_insurance_coverage\", \"arguments\": {\"bank\": \"華南銀行\", \"ntd_deposit\": 6620000, \"fx_deposit_twd_equiv\": 3750000}}, {\"name\": \"credit_card_revolving_interest\", \"arguments\": {\"balance\": 140000, \"apr\": 14.82, \"days\": 90}}]"
}

品質指標

由 scripts/validate_dataset.py 產出:

指標數值
train / test1,080 / 120(90.0% : 10.0%)
函式呼叫總數1,493(平均每題 1.24 次)
平均提供工具數2.51(含干擾項)
參數溯源率99.98%(5,716 / 5,717)
train/test 完全重複0 筆
結構性錯誤0

「參數溯源率」指 answer 中每個參數值都能在題目文字裡找到來源。 題目沒提到的參數一律不會出現在 answer(該參數有 default 可用), 以符合 system prompt「不得臆測參數值」的要求。 (唯一未通過的 1 筆是驗證器對整數型 enum 的邊界案例,非資料缺陷。)

challenge config:驗收挑戰集

40 題,欄位與 train/test 不同:id / phenomenon / query_zhtw / tools / expected_behavior / scoring / rubric。

涵蓋 8 類 IID 測試集在結構上量不到的現象,每類 5 題: 口語與非標準輸入、參數不足需追問、無適用工具需拒答、錯誤前提、 多輪上下文、時效性衝突、單位與量詞陷阱、近似工具混淆。

其中 8 題的正確行為是「不要呼叫任何工具」(scoring: must_not_call), 32 題需要人工或 LLM-judge 依 rubric 評分。這正是重點: 驗收評測無法用 exact match 完成,必須有領域方定義的評分準則。

已知限制

  • —合成資料的同構性:think 由模板組合生成,句式多樣性有限。 以此微調的模型可能學到「推理鏈的外觀」而非推理能力本身。
  • —IID 切分的樂觀偏誤:test 是從同一個生成器隨機切出的。實測 test 的 query 模板 100% 在 train 出現過,與訓練集最相似樣本的字元 5-gram Jaccard 平均達 0.42。 在這個 test set 上的高分不代表真實場景的表現。
  • —工具為虛構 schema:不對應任何可呼叫的真實 API。
  • —法規時效:以 2026-09 的公開資訊為準,之後的修法未反映。

重現方式

bash
python3 src/build_dataset.py --n 1200 --seed 20260909   # 產生 train/test
python3 scripts/build_challenge_set.py                  # 產生挑戰集
python3 scripts/validate_dataset.py                     # 品質驗證
python3 scripts/leakage_report.py                       # 樂觀偏誤分析

資料來源

制度參數整理自台灣公開資訊,逐項出處見 `docs/SOURCES.md`。 欄位規格參考 twinkle-ai/tw-function-call-reasoning-10k(CC-BY-4.0)—— 僅參考其 schema 設計,未使用其任何資料內容。

引用

bibtex
@misc{tw_finance_function_call_reasoning_2026,
  title  = {tw-finance-function-call-reasoning: A Research-Only Traditional Chinese
            Function-Calling Dataset for Taiwan Financial Scenarios},
  author = {Simon Liu},
  year   = {2026},
  note   = {CC BY-NC 4.0. Research use only, not for commercial use.},
  url    = {https://huggingface.co/datasets/Simon-Liu/tw-finance-function-call-reasoning}
}