跳至主要內容

2026-07-20 地端小型語言模型與 AI 輔助通聯紀錄分析

Q 版主題圖:地端小型語言模型與 AI 輔助通聯紀錄分析

📚 科技研發科週(07-20~07-24)|本篇為公開題材整理,非當日實習日誌。 內容接續 07-17 記的關聯分析:那篇談人工把紀錄整理成可查證的問題,這篇談把這件事交給模型之後,哪些條件變了、哪些一個字都沒變。所有規範狀態以查核日 2026-07 的公開資料為準。

起點是一句但書

我原本以為「公務機關能不能用 AI」是一個整體問題,查下來發現答案早就寫在 《行政院及所屬機關(構)使用生成式 AI 參考指引》(112/08/31 院會通過、112/10/03 函頒)第四點裡,而且切法跟我想的不一樣。

第四點前段禁止業務承辦人向生成式 AI 提供涉及公務應保密、個人及未經機關同意公開的資訊,也不得拿可能涉及機密業務或個人資料的問題去問。接著是那句但書:

但封閉式地端部署之生成式 AI 模型,於確認系統環境安全性後,得依文書或資訊機密等級分級使用。

界線劃在部署方式,不是模型能力。同一個模型放在別人的雲端上就不能碰機敏資料,搬進機關自己的封閉環境、確認過安全性,就能依機密等級分級使用。這個切法我覺得相當務實:能不能用的關鍵是資料會不會離開機關,而不是模型參數量多少、benchmark 跑多高。

Q 版示意圖:封閉環境裡的地端小型語言模型

示意:封閉環境裡的地端小型語言模型。此圖僅為概念示意,不代表任何實際系統或作業流程。

一、指引把界線劃在哪幾條

點次規範
第二點生成式 AI 產出的資訊,須由業務承辦人就其風險作客觀且專業的最終判斷,不得取代承辦人的自主思維、創造力及人際互動。
第三點製作機密文書應由承辦人親自撰寫,禁止使用生成式 AI(機密文書指行政院「文書處理手冊」所定的國家機密文書及一般公務機密文書)。
第四點不得向生成式 AI 提供應保密、個人及未經同意公開的資訊;封閉式地端部署經確認安全性後得分級使用。
第五點不可完全信任 AI 產出,不得以未經確認的產出內容直接作成行政行為或作為公務決策的唯一依據
第六點以生成式 AI 作為執行業務或提供服務的輔助工具時,應適當揭露。
第八點各機關應就所辦採購事項,要求得標的法人、團體或個人注意本指引,並遵守機關訂定的規範或內控管理措施。

第三點跟第四點常被混講,其實管的是兩件事:第三點禁的是「拿 AI 寫機密文書」,第四點禁的是「把機敏資料餵進去」。前者連地端都不放行,後者才有地端但書。

看下來比較容易被忽略的是第八點。它把約束擴到得標廠商,接上的是 《資通安全管理法》第 10 條 的委外監督義務:委外辦理資通系統建置、維運或資通服務提供時,要選任適當的受託者、要求其建立有效的資通安全管理機制並監督實施。從這個角度看,用雲端 AI 服務處理業務資料,本質上就是一次委外,只是它不長得像傳統的委外案。

二、為什麼是「小」模型

地端部署會反過來限制模型大小。要進機關自己的機房,硬體、電力、維運人力全部得自己扛,還要有人負責更新與安全評估。這條件下能落地的通常是參數規模較小、跑得動也養得起的模型,不是規模最大的那一批。所以「地端」跟「小模型」在公部門幾乎是綁在一起出現的。

本土可用的公開選項是 TAIDE(推動臺灣可信任生成式 AI 發展計畫),國科會指導、國家實驗研究院執行。官網 模型下載頁 列出的釋出版本由新到舊包含 Embeddinggemma-GTAIDE-300m-2605、Gemma-3-TAIDE-12b-Chat 系列、Llama-3.1-TAIDE-LX-8B-Chat、Llama3-TAIDE-LX-8B-Chat-Alpha1 與 TAIDE-LX-7B 系列,最近一次公開更新是 2026/06/12。它採用的是 TAIDE 自訂的模型授權同意書,不是標準開源授權,實際能不能用、用在哪,我會回去讀授權條款。

這裡要誠實標一件事:我查不到官方公布的「哪些機關已導入 TAIDE」清單,二手報導有講但沒有官方文件佐證,所以不寫。(2026-07 複查 TAIDE 官網與國科會網站,仍只有分領域的應用示例,沒有官方彙整的導入機關名單。)

另一件值得記的是,地端不等於安全。國家資通安全研究院公布過 《DeepSeek AI 離線下載模型資安測試報告》,結論是安全性及防護機制不足、建議不要使用。測的正是離線下載的模型,也就是說即使關在自己機房裡、完全不連外,模型權重本身仍可能是風險來源。指引第四點寫「於確認系統環境安全性後」,確認的不只是網路隔離,模型本身也在要確認的範圍內。

三、通聯紀錄的法律位置,一個字都沒因為 AI 改變

佐證:《通訊保障及監察法》第 3 條之 1(113/07/31 修正,第 3 項「網路流量紀錄」為該次新增)。

資料種類法定定義(第 3 條之 1)
通信紀錄用戶或電信使用人使用電信服務後,公眾電信網路所產生之發送方、接收方之電信號碼、通信時間、使用長度、位址、服務型態、信箱或位置資訊等紀錄。
通訊使用者資料用戶或電信使用人姓名或名稱、身分證明文件字號、地址、電信號碼及申請各項電信服務所填列之資料。
網路流量紀錄用戶或電信使用人使用電信服務後,公眾電信網路所產生之通訊設備識別資料、網際網路位址與位置資訊、通信時間、連線用量與封包數量、網域名稱、應用服務類型及協定等未涉及通訊內容之紀錄。

取得程序在 第 11 條之 1,三種資料待遇不同。通訊使用者資料由檢察官或司法警察官在有必要性及關連性時即可調取,不需調取票。通信紀錄與網路流量紀錄則要由檢察官以書面向該管法院聲請核發調取票,司法警察官得報請檢察官許可後聲請;急迫情形不及事先聲請者,應於二十四小時內補行聲請。

例外是重罪清單:偵辦最輕本刑十年以上有期徒刑之罪,以及強盜、搶奪、詐欺、恐嚇、擄人勒贖、妨害電腦使用、脫逃,與違反人口販運防制法、槍砲彈藥刀械管制條例、懲治走私條例、毒品危害防制條例、組織犯罪防制條例、廢棄物清理法、兒童及少年性剝削防制條例、洗錢防制法、國家安全法、反滲透法、總統副總統選舉罷免法、公職人員選舉罷免法等罪時,得不受前述限制。這裡的門檻用語是「最輕本刑」,我第一次抄成「最重本刑」,兩者範圍差很多。

整理完這段最大的收穫是:AI 只出現在資料已經合法到手之後的那一段。它讓分析變快,但取得那關的門檻、令狀、時限完全沒動。07-17 記過一句「系統查得到,不代表法律允許查」,換成模型也一樣,我甚至更要提醒自己,因為工具越好用,越容易先做了再想程序。

四、AI 幫得上哪一段

07-17 把分析拆成基本分析與進階分析:前者從已知線索找候選、縮小範圍,後者用多個維度支持或排除關聯。這兩段對 AI 的適配度差很多。

候選篩選與排序是模型幫得上忙的地方,資料量大、要看的維度多、人工翻很慢,讓模型先排個順序合理。關聯的成立與否我就不敢交出去。07-17 寫過「排除比累積難,條件越加越多結果看起來越乾淨,其實只是把不利的資料濾掉了」,這句話放到模型上更嚴重:模型天生擅長找相似、不擅長主動去找推翻自己的反例,而規模一放大,誤判也跟著等比例放大。

規範上的依據有兩層。指引第五點要求不得以未經確認的產出直接作成行政行為或作為公務決策的唯一依據;《人工智慧基本法》第 4 條(114/12/23 三讀、115/01/14 公布,依第 20 條自公布日施行)則列了原則,其中第五款要求 AI 的產出應做適當資訊揭露或標記以利評估風險,第六款要求盡可能避免演算法偏差與歧視,第七款要求確保承擔相應責任,包含內部治理責任及外部社會責任。

不過這裡有個界線要講清楚:現行查無規範「AI 分析結果在刑事證據法上地位」的公開文件。指引第五點寫的是「行政行為」與「公務決策」,那是行政程序的語言,不能直接套用到刑事證據規則。要談證據能力,還是得回到 07-10 整理的那條線,也就是 《刑事訴訟法》第 158-4 條 的權衡與監管鏈、可重現性那套要求。AI 產出要進到那個框架裡,我看下來可重現性會是最難的一項。

五、我還沒有答案的地方

揭露要揭露到什麼程度。 指引第六點只說「應適當揭露」,沒有講對誰揭露、寫在哪。行政文書上註明用了 AI 輔助不難,但如果分析結果最後進了偵查卷證,揭露的對象、方式與詳細程度該怎麼定,查下來目前只有原則——生成式 AI 指引第六點的「應適當揭露」,加上 《人工智慧基本法》 的「透明與可解釋」原則——都沒有落到「對誰、用什麼方式、到什麼程度」的具體辦法,相關子法也還沒發布。這一塊是查證後確認的空白。

地端模型的稽核週期。 指引要求「確認系統環境安全性」,可是模型換版本、換權重之後要不要重新確認、多久評估一次、誰負責,指引沒有寫到這一層。從系統維運的角度看,這種一次性確認最容易變成上線那天做過就沒再碰。

小模型的幻覺成本。 參數規模小通常意味著更容易產生看起來合理但錯誤的內容。在寫公文的場景,錯了有人會校;在偵查線索排序的場景,錯誤是「把不該排前面的排前面」,不會報錯、也不容易被發現。這個成本怎麼估,我目前只有直覺,沒有依據。

這篇的分層結構

把這篇從「憑什麼能用」疊到「用完怎麼交代」:

text
第 1 層  界線劃在哪
         問什麼:模型部署在哪、資料會不會離開機關
         產出:能不能碰機敏資料的判斷,以及依機密等級分級使用的前提
            ↓ 要留在機關內,硬體、電力與維運就得自己扛

第 2 層  地端與小模型
         問什麼:機房養得起多大的模型、模型本身安不安全
         產出:可落地的參數規模、授權條款的檢查結果、環境與模型權重的安全確認
            ↓ 環境備好了,資料本身怎麼拿

第 3 層  取得資料的法定程序
         問什麼:這筆是哪一種資料、要不要調取票、急迫時怎麼補
         產出:三種資料的程序分流、聲請與補聲請的時限、重罪例外的適用判斷
            ↓ 合法到手之後,模型才進場

第 4 層  AI 幫得上哪一段
         問什麼:哪一段可以交給模型、哪一段交出去會出事
         產出:候選篩選與排序的分工,以及關聯成立與否仍由人判斷的界線
            ↓ 用了之後怎麼交代

第 5 層  揭露與證據定位
         問什麼:對誰揭露、揭露到什麼程度、產出算不算得上證據
         產出:適當揭露與不得作為唯一依據的要求,以及刑事證據地位這塊空白
Q 版分層示意圖:由下而上為界線劃在哪、地端與小模型、取得資料的法定程序、AI 幫得上哪一段、揭露與證據定位

圖示對應上方五層,只是概念示意,不代表任何實際系統或作業流程。

**重點:**這篇從「憑什麼能用」疊到「用完怎麼交代」。第 1 層的界線劃在部署方式,指引第四點但書放行封閉式地端部署、確認系統環境安全性後得依機密等級分級使用,判準是資料會不會離開機關。第 2 層的小是被機房逼出來的,TAIDE 採自訂授權要回去讀條款,地端也不等於安全。第 3 層一個字都沒因為 AI 改變:通信紀錄與網路流量紀錄要調取票,急迫不及的二十四小時內補聲請,門檻用語是最輕本刑,AI 只出現在資料合法到手之後。第 4 層候選篩選與排序可以交給模型,關聯的成立與否不行。第 5 層揭露與證據定位還沒寫完,現行查無 AI 分析結果在刑事證據法上地位的公開文件。最強的拉扯在第 2 層與第 5 層:模型越小、換版本越勤,揭露與可重現越難寫。

往下追問:「確認系統環境安全性」該多久重做一次,換權重算不算重來?可重現性要做到什麼程度,AI 產出才進得了證據能力的框架?

本日對應主題

同系列日誌

主要來源(查核日期 2026-07)

頡譯的實習筆記:內容已去識別化,法規以官方來源為準。