繁體中文抽取式閱讀理解(extractive QA)QLoRA adapter,微調自 unsloth/Qwen3-8B,訓練資料為 DRCD(改編版,見下方 SFT dataset)。
Fonte do modelo
Trecho da fonte
繁體中文抽取式閱讀理解(extractive QA)QLoRA adapter,微調自 unsloth/Qwen3-8B,訓練資料為 DRCD(改編版,見下方 SFT dataset)。
Fontes
1 fonteVerificado 25 de set.
Artefatos de modelo
1 artefatoTrechos de fonte
2 trechos--- license: apache-2.0 base_model: unsloth/Qwen3-8B language: - zh tags: - qlora - lora - peft - question-answering - extractive-qa - traditional-chinese - drcd - qwen3 --- # Qwen3-8B-DRCD-zhTW-QA-LoRA 繁體中文抽取式閱讀理解(extractive QA)QLoRA adapter,微調自 `unsloth/Qwen3-8B`,訓練資料為 [DRCD](https://github.com/DRCKnowledgeTeam/DRCD)(改編版,見下方 SFT dataset)。 輸出固定 JSON schema:`{"answer": "文中連續原文片段", "answerable": true|false}`。 > **已知限制**:這個 checkpoint 在 DRCD 抽取式 QA 上表現接近滿分,代價是通用能力小幅退步。 > TMMLU+(通用知識選擇題)**test split 全量 20,118 題**上,macro accuracy 從原廠的 0.5936 > 掉到 0.5604(**Δ = −3.32 個百分點,95% CI [−3.96, −2.69]**,配對分層 bootstrap)。 > > 退步的型態是**選項偏誤**而不是知識遺忘:微調後模型選 B 的次數比原廠少 1,946 次、選 D 多 > 1,889 次,於是 gold 為 B 的題目掉 16.9 個百分點,而 **gold 為 D 的題目反而進步 7.7 個 > 百分點**。忘掉知識的模型不會在某個子集上變強。 > > **這個偏誤有 45% 校正得回來**(160,880 次推論實測):把四個選項的內容做循環位移、 > 讓正確答案輪流落在 A/B/C/D 再投票,Δ 從 −3.46 pp 縮到 −1.92 pp,回收 +1.54 pp > (95% CI [+0.90, +2.19])。偏誤撐過了位移(位移後 FT 仍只有 14.7% 選 B、32.2% 選 D), > 確認是位置偏誤而非集成效應。 > > 剩下的約 1.9 pp **不能**反推為「知識遺忘」——這個實驗只隔離位置偏誤,沒有檢定跟選項 > 內容綁在一起的偏誤。另外多數決是評分協定、不是模型本身的性質:你直接使用時拿到的 > 仍是單一順序的行為,投票要付 4 倍推論成本。 > > 如果需要保留通用能力,建議:(a) 只在需要精確抽取式 QA 的場景使用這個 adapter, > (b) 選擇題場景加上選項順序隨機化的多數投票(實測可回收約四成退步), > (c) 或參考本專案方法論自行用較低 epoch / 加入通用資料混合訓練。 ## 評估結果(DRCD dev,完整 4,699 題) | # | 組別 | overall EM | overall F1 | JSON 合法率 | |---|------|-----------:|-----------:|-------------:| | 1 | base zero-shot(原廠) | 0.4756 | 0.6858 | 95.62% | | 2 | base few-shot(3-shot) | 0.8253 | 0.9191 | 99.98% | | 3 | **本 adapter(未量化 bf16)** | **0.9325** | **0.9704** | 100% | | 4 | 本 GGUF(Q8_0) | 0.9328 | 0.9706 | 100% | | 5 | 本 GGUF(Q4_K_M,部署建議) | 0.9330 | 0.9700 | 100% | n=4,699(DRCD 官方 dev split 完整題目,3,524 可回答 + 1,175 unanswerable,未抽樣)。 **量化最多吃掉微調增益的 0.65%**(EM,配對分層 bootstrap 的 95% CI 下界;點估計實際還 微幅為正)。不過量化並非 no-op:Q4 有 2.68% 題目的答案文字與未量化不同,只是變好 33 題、 變壞 35 題互相抵銷(McNemar p=0.90),所以整體指標看起來沒動。 詳細方法論、TMMLU+ forgetting check(全量 20,118 題,macro accuracy −3.32 個百分點)、 錯誤案例分析見專案 EVAL_REPORT.md。 ## 訓練細節 - 基底模型:`unsloth/Qwen3-8B`(LoRA 實際合併/推論用的起點權重;跟官方 [`Qwen/Qwen3-8B`](https://huggingface.co/Qwen/Qwen3-8B) 同源, unsloth 版本額外做了 tokenizer 修正) - 方法:QLoRA(4-bit 訓練),Unsloth,r=16 / alpha=16 / dropout=0,target modules 涵蓋 q/k/v/o/gate/up/down 全線性層 - 資料:9,800 筆訓練(DRCD train split 抽樣,另留 200 筆 eval holdout),2 epochs, effective batch 16,lr 2e-4 cosine schedule - 硬體:Google Colab Pro,NVIDIA L4 - 訓練曲線:[W&B run](https://wandb.ai/tunyu1/qwen3-drcd-q...
Source context: 10 downloads · 0 likes · Pipeline question-answering · Library peft · Repo steven0226/Qwen3-8B-DRCD-zhTW-QA-LoRA