這種方法透過自訂資料集訓練模型,讓語調的一致性直接寫入模型的權重中,而不只是提示詞的指令。資料需求量差異很大:GPT-3.5 需要 50–100 個範例,而 Llama 或 Mistral 等開源模型則需要 300–800 個範例 。微調可以產出最一致的輸出,但只有在提示工程和 RAG 仍不足夠時,投入微調的報酬率才會顯現。
列出 3–5 個語調形容詞、常用詞彙、禁用詞彙、句子長度規則,以及「該這樣做 vs. 不該這樣做」的範例。關鍵是:必須包含每條規則背後的理由,而不只是規則本身 。傳統的 PDF 品牌顏色與標誌使用指南是不夠的——你需要一份具備範例、可供機器讀取的規格
。
對多數團隊來說,最務實的路徑是:撰寫一份詳細的語調規格 → 當作系統提示詞使用 → 加入 RAG 知識庫(收錄你的最佳內容)→ 透過接受/拒絕反饋循環持續迭代。 只有在你有 100 個以上範例、且提示工程仍不夠用時,才值得投入完整微調。