Simon-Liu/tw-finance-function-call-reasoning
tw-finance-function-call-reasoning 台灣金融場景的繁體中文 function-calling + 推理鏈微調資料集。 欄位規格對齊 twinkle-ai/tw-function-call-reasoning-10k。 ⚠️ 使用限制:僅供研究,不得商業使用 本資料集以 CC BY-NC 4.0 授權釋出,僅供學術研究、模型能力探索與方法驗證之用。 請務必理解以下事項後再使用: 不得作商業用途。 包含但不限於:訓練用於對外營利的模型、包裝為付費產品或服務、 作為商業交付物的一部分。若有商業需求,請自行重新建置資料並取得合規來源。 這不是財務、稅務、法律或投資建議。 資料中的稅率、費率、法規門檻雖依 2026 年 (民國 115 年)台灣公開資訊整理,但可能已經過時或有誤。任何實際決策前, 請以主管機關公告為準(財政部、金管會、勞動部、衛福部、中央銀行、全國法規資料庫)。 內容為程式化合成,非真實考題逐字收錄。 題目由模板與參數取樣組合而成,… See the full description on the dataset page: https://huggingface.co/datasets/Simon-Liu/tw-finance-function-call-reasoning.
tw-finance-function-call-reasoning
台灣金融場景的繁體中文 function-calling + 推理鏈微調資料集。 欄位規格對齊 `twinkle-ai/tw-function-call-reasoning-10k`。
⚠️ 使用限制:僅供研究,不得商業使用
本資料集以 CC BY-NC 4.0 授權釋出,僅供學術研究、模型能力探索與方法驗證之用。
請務必理解以下事項後再使用:
- 不得作商業用途。 包含但不限於:訓練用於對外營利的模型、包裝為付費產品或服務、 作為商業交付物的一部分。若有商業需求,請自行重新建置資料並取得合規來源。
- 這不是財務、稅務、法律或投資建議。 資料中的稅率、費率、法規門檻雖依 2026 年 (民國 115 年)台灣公開資訊整理,但可能已經過時或有誤。任何實際決策前, 請以主管機關公告為準(財政部、金管會、勞動部、衛福部、中央銀行、全國法規資料庫)。
- 內容為程式化合成,非真實考題逐字收錄。 題目由模板與參數取樣組合而成, 並非任何證照考試的原始試題。工具(function)的 schema 為虛構的 API 介面設計, 不對應任何真實可呼叫的服務。
- 不得用於自動化的金融決策或客戶服務,除非已由具備資格的專業人員完整審閱與驗證。
- 資料中的人名、金額、帳戶情境均為虛構,不含任何真實個人資料。
一句話總結:這是一份研究用的方法論展示資料集,不是可以直接上線的產品資產。
資料集概覽
領域分佈
securities 台股交易|tax 稅務|pension 勞健保與退休金|banking 銀行存放款| funds 基金與 ETF|fx 外匯|bond 債券與利率|compliance 法令遵循| credit 信用與授信|planning 財務規劃|knowledge 金融知識查詢
欄位規格
與參考資料集完全一致的 7 個欄位:
messages[2] 的格式為 <think>...</think> 後接一至多個 <tool_call>...</tool_call>。
範例
{
"id": 100004,
"query_zhtw": "同一家華南銀行放 6620000 元台幣加 3750000 元外幣,中央存保賠付上限是多少?同時,請算信用卡循環信用利息,未清償餘額 140000、年利率 14.82%、期間 90 天。",
"answer": "[{\"name\": \"deposit_insurance_coverage\", \"arguments\": {\"bank\": \"華南銀行\", \"ntd_deposit\": 6620000, \"fx_deposit_twd_equiv\": 3750000}}, {\"name\": \"credit_card_revolving_interest\", \"arguments\": {\"balance\": 140000, \"apr\": 14.82, \"days\": 90}}]"
}品質指標
由 scripts/validate_dataset.py 產出:
「參數溯源率」指 answer 中每個參數值都能在題目文字裡找到來源。 題目沒提到的參數一律不會出現在 answer(該參數有 default 可用), 以符合 system prompt「不得臆測參數值」的要求。 (唯一未通過的 1 筆是驗證器對整數型 enum 的邊界案例,非資料缺陷。)
challenge config:驗收挑戰集
40 題,欄位與 train/test 不同:id / phenomenon / query_zhtw / tools / expected_behavior / scoring / rubric。
涵蓋 8 類 IID 測試集在結構上量不到的現象,每類 5 題: 口語與非標準輸入、參數不足需追問、無適用工具需拒答、錯誤前提、 多輪上下文、時效性衝突、單位與量詞陷阱、近似工具混淆。
其中 8 題的正確行為是「不要呼叫任何工具」(scoring: must_not_call), 32 題需要人工或 LLM-judge 依 rubric 評分。這正是重點: 驗收評測無法用 exact match 完成,必須有領域方定義的評分準則。
已知限制
- 合成資料的同構性:
think由模板組合生成,句式多樣性有限。 以此微調的模型可能學到「推理鏈的外觀」而非推理能力本身。 - IID 切分的樂觀偏誤:test 是從同一個生成器隨機切出的。實測 test 的 query 模板 100% 在 train 出現過,與訓練集最相似樣本的字元 5-gram Jaccard 平均達 0.42。 在這個 test set 上的高分不代表真實場景的表現。
- 工具為虛構 schema:不對應任何可呼叫的真實 API。
- 法規時效:以 2026-09 的公開資訊為準,之後的修法未反映。
重現方式
python3 src/build_dataset.py --n 1200 --seed 20260909 # 產生 train/test
python3 scripts/build_challenge_set.py # 產生挑戰集
python3 scripts/validate_dataset.py # 品質驗證
python3 scripts/leakage_report.py # 樂觀偏誤分析資料來源
制度參數整理自台灣公開資訊,逐項出處見 `docs/SOURCES.md`。 欄位規格參考 twinkle-ai/tw-function-call-reasoning-10k(CC-BY-4.0)—— 僅參考其 schema 設計,未使用其任何資料內容。
引用
@misc{tw_finance_function_call_reasoning_2026,
title = {tw-finance-function-call-reasoning: A Research-Only Traditional Chinese
Function-Calling Dataset for Taiwan Financial Scenarios},
author = {Simon Liu},
year = {2026},
note = {CC BY-NC 4.0. Research use only, not for commercial use.},
url = {https://huggingface.co/datasets/Simon-Liu/tw-finance-function-call-reasoning}
}