Key Findings
- 「機密資料不能上雲」不再是導入 AI 的阻力:開源 LLM 加地端部署可以讓資料完全不出企業機房,且多數企業場景的能力已經夠用[1]
- 地端 vs 雲端是成本與資安的權衡,不是技術優劣:用量大且穩定時,地端的單位成本一至兩年內反超雲端 API
- 成敗關鍵通常不在模型,而在 RAG 知識庫的品質與量化部署的工程細節
企業單位有機密資料分析需求,可以使用 AI 的地端模型、不連上雲端運算嗎?可以,而且這已是台灣製造、金融與醫療業的常見選擇:把開源 LLM 部署在企業自己的機房(或私有雲),搭配 RAG 知識庫引用內部文件回答,資料全程不出門。本文拆解四個決策點:什麼場景該選地端、模型與硬體怎麼選、要花多少錢、以及資安治理怎麼做。
一、什麼情況該選地端?
- 法遵與個資:涉及個資法規範的客戶資料、醫療資料,或內部規範禁止資料出境[2]
- 營業秘密:製程參數、配方、報價邏輯等核心機密的分析與問答
- 高用量場景:每天數萬次以上的穩定呼叫量,地端單位成本更低
- 網路隔離環境:工廠產線、封閉內網等本來就不連外的場域
反過來說:用量小、場景還在探索、資料不敏感——先用雲端 API 驗證價值,證明有效再評估地端化,這是最不浪費的順序(整體導入路徑見企業導入生成式 AI 完全指南)。
二、模型與硬體選型
| 模型規模 | 硬體需求(推論) | 適用場景 | 備註 |
|---|---|---|---|
| 7B–14B | 工作站級 GPU 單卡 | 知識問答、摘要、分類 | 搭配 RAG 已可覆蓋多數內部場景 |
| 30B–70B | 伺服器級 GPU 單卡至雙卡 | 複雜推理、長文件、程式輔助 | INT4 量化可大幅壓低顯存需求 |
| 70B 以上/MoE | 多卡叢集 | 高併發服務、對外產品 | 需專業維運,先確認用量撐得起 |
兩個工程重點:量化(INT8/INT4 讓同一張卡跑更大的模型,精度損失多數場景可接受,原理見模型量化完全指南)與推論框架(vLLM 等框架的批次處理能力直接決定同樣硬體能服務多少人)。
三、成本結構:地端 vs 雲端
| 項目 | 雲端 API | 地端部署 |
|---|---|---|
| 前期投資 | 近乎零 | 硬體數十萬~數百萬元(依規模) |
| 變動成本 | 依 token 用量計費,隨用量線性成長 | 電力與維運,近乎固定 |
| 損益平衡 | 穩定高用量下,地端通常一至兩年追平;低用量則雲端始終便宜 | |
| 資料位置 | 供應商雲端 | 企業機房,不出門 |
混合架構是務實解:機密場景走地端小模型、一般場景走雲端 API——用資料分級決定路由,而不是全有或全無。多數我們輔導的企業最終落在這個架構。
四、資安與治理清單
- 資料分級:哪些資料可進 RAG 知識庫、哪些連地端模型都不該碰
- 權限控管:知識庫檢索需繼承既有的文件權限,避免「AI 幫你越權看文件」
- 輸出稽核:高風險輸出(對外文件、決策建議)保留人工覆核與紀錄
- 模型更新:開源模型的版本管理與回歸測試機制
五、導入建議
地端部署的技術棧(模型、量化、RAG、推論框架)每一層都有坑,建議以 8 週 PoC 驗證:第一階段用單卡工作站與 7B–14B 模型加 RAG,跑通一個真實場景並量測回答品質,再決定正式硬體投資規模。我們的 PoC 合作計畫可協助完成選型、建置與品質評測;有政府補助需求(地端建置屬常見的智慧化導入項目)可參考台灣 AI 補助全攻略。



