外觀
2026-07-07 資料整合偵查與解決問題的能力

🔍 實習單位:內政部警政署刑事警察局 偵查第九大隊(偵九隊)|偵九隊階段第 2 天。
資料整合、問題拆解、新技術評估其實是同一條線:都要回到問題、證據、法源和維運。個別案件、內部工具、平台配置與操作方法不納入公開內容。
今天整理的幾件事
多源資料整合,我原本以為難在格式。後來才發現順序比格式重要:每筆資料的來源和限制先各自留著,再統一格式、拉時間軸,提了假設還要找獨立資料交叉比對。
新技術評估也是同一套:效果之外還得看業務需求、法源、資料品質、隱私影響和維運成本。資訊能力讓驗證跑得快,偵查能力負責把問題定義清楚、程序守住、結論說得出道理,少一邊都撐不住。

示意:把多來源資料拼成一致的整體。此圖僅為概念示意,不代表任何實際系統或作業流程。
一、多源資料交叉比對:先分開,再連結
佐證:證據應依法取得、調查與評價;違反法定程序取得的證據,法院須權衡人權保障與公共利益,見 《刑事訴訟法》第 158-4 條。
第一個反應是把所有資料倒進同一張表。後來想想,這樣等於一開始就把每筆資料能說明什麼、不能說明什麼全洗掉。先分開看,能從六個角度建立查證地圖:
| 資料角度 | 可以協助釐清的問題 | 需要保留的限制 |
|---|---|---|
| 人 | 哪些身分、角色或關係值得進一步確認? | 帳號、聯絡資料與實際使用者不必然相同。 |
| 帳號與設備 | 是否存在可比對的使用或管理脈絡? | 單一帳號或裝置可能共用、移轉或遭冒用。 |
| 時間 | 不同事件是否具有可驗證的先後或重疊關係? | 時區、紀錄延遲與格式差異都可能影響判讀。 |
| 地點 | 是否存在活動範圍或場域上的關聯? | 位置資料通常是範圍或線索,不是精確事實。 |
| 金流與資源 | 是否有可回查的交易、服務或資源流向? | 交易紀錄不能單獨說明實際決策或犯罪意圖。 |
| 數位紀錄 | 是否有服務使用、登入或通訊上的關聯線索? | 需要確認來源、完整性與取得程序。 |
事實、假設與結論要分層寫
寫的時候分三層。已確認事實只寫紀錄本身撐得住的話,像「紀錄顯示某項活動在特定時間出現」,不能把單一筆紀錄擴寫成一個完整事件。待驗證假設的寫法是「此關聯值得以其他來源進一步查證」,一旦寫成身分、意圖或因果,就等於跳過了查證。可支持的結論要等多項獨立資料互相印證後才寫,而且不能把相反資料、替代解釋或證據限制略掉。
三層裡我最難守的是中間那層,假設寫著寫著就滑成結論,句子往往只差幾個字。分層寫的好處是,接手的人看得出每句話有幾分證據;新資料進來,動到的多半只有「假設」那層,第一個判斷不會把整份分析綁死。
二、資料整合的五步流程
用哪個工具沒那麼關鍵,關鍵是每一步都留得下能被檢查的痕跡:
text
保留來源 → 標準化欄位 → 對齊時間與關係 → 驗證假設 → 產出可閱讀說明第一步保留來源,記錄資料由何處、依何程序取得,留下可回查的來源說明。接著標準化,把時間、名稱、格式與缺漏標記統一,換成可比較的資料表或事件清單。第三步建立關係,依時間、帳號、服務或交易等欄位拉出可能的關聯,產物是待驗證的關係圖或時間軸。
再來是交叉驗證,找獨立資料檢查是否一致,寫出來的判斷要同時交代支持力和侷限。最後清楚呈現,把方法、限制與結論分開表達,讓非技術人員也檢視得動。五步裡看下來最容易被跳過的是最後一步:資料整完了就想直接講結論,限制那段常常沒寫。
資訊背景的人能出力的,大概是顧好資料品質、少一點手工出錯,再把複雜關係畫成別人能挑毛病的圖。第 2 步和第 4 步很像 ETL 跟測試:標準化是清資料,交叉驗證是拿另一組來源當斷言。差別在程式跑錯重跑就好,這裡錯了會變成一個講不清楚來源的結論。
三、解決問題的能力:從症狀回到根因
面對沒有固定答案的問題,這個順序可以避免太早選定工具:
- 定義問題:現在的困難是資料不足、流程延遲、資訊不一致,還是判斷依據不清?
- 拆解條件:有哪些已知事實、未知事項、限制與利害關係人?
- 比較方案:不同做法的效益、風險、成本與法源是否可說明?
- 小範圍驗證:先用可控情境檢驗假設,再決定是否擴大使用。
- 留下可回顧紀錄:記錄選擇理由與結果,讓下一次能改善而不是重做。
四、新技術評估:效果之外還要看什麼
「能不能做」只是第一題,通常也最好回答。後面還有五題。業務價值問它要解決哪個具體問題、是否比現有流程更好;法源與權利問有沒有明確授權,對隱私、平等或程序權利的影響是否可接受;資料品質問輸入資料是否可靠、可解釋,有沒有偏誤或缺漏。
剩下兩題更往後看。安全與濫用風險要講清楚誰能使用、如何限制範圍、如何發現異常;維運與退出要交代成本、供應依賴、資安更新,以及停止使用之後的資料怎麼處理。
這五題放到新型數位服務、AI 或穿戴裝置也一樣用。比對更快當然是優點,但方便撐不起導入的理由;必要性、資料最小化、權限稽核,還有出錯怎麼救濟,都得先有答案。
五題裡我最在意「維運與退出」。導入時沒人想談停用那天,但資料怎麼清、依賴怎麼解,拖越久越貴。能跑起來的系統很多,能好好關掉的沒幾個。
補充(公開資料,2026-07 查核):以「虛擬資產金流追蹤」套用上表——鏈上交易雖公開可追溯,但位址為假名、須與鏈下 KYC 等資料勾稽,混幣與跨鏈會弱化可追溯性,商業工具的位址叢集屬機率推論、可能誤判(可對照 FATF 虛擬資產針對性更新(2025))。AI 關聯分析同理,須符合 《人工智慧基本法》(114/12/23 三讀、115/01/14 公布,自公布日施行)的可解釋與不歧視原則並保留人工複核。原理、監理狀態與法治界線見 2026-07-09 與 2026-07-10。
五、資料治理與隱私保護的共同底線
佐證:公務機關蒐集、處理與利用個人資料,須有法定職務必要範圍並受特定目的限制,見 《個人資料保護法》第 5、15、16 條。
資料整合越完整,對隱私的影響越大,所以我會一直回頭確認:
- 是否只使用完成任務所需的最少資料?
- 是否把資料來源、處理目的、接觸權限與保存期間說清楚?
- 是否讓資料分析結果保有人工檢視與更正的空間?
- 是否能在任務結束後依規定限制使用、保存或刪除?
這四題問下來,「資料驅動」就不會只剩效率一個指標,被外面查的時候也站得住腳。
這一天的分層結構
這天的順序是先定義問題、最後才問要不要用,中間每一層都在替前一層收尾:
text
第 0 層 問題定義
問什麼:困難是資料不足、流程延遲、資訊不一致,還是判斷依據不清
產出:講得出口的問題敘述、已知與未知的清單、限制與利害關係人
↓ 問題講清楚,才知道要看哪些資料
第 1 層 各源分開看
問什麼:人、帳號設備、時間、地點、金流、數位紀錄各自釐清得了什麼
產出:六個角度的查證地圖,每一格都掛著自己的限制
↓ 限制留住了,再談怎麼接起來
第 2 層 整合五步
問什麼:來源留不留得住、欄位對不對得齊、關係接不接得起來、別人看不看得懂
產出:可回查的來源說明、標準化後的事件清單、待驗證的關係圖與時間軸
↓ 接起來了,話要怎麼寫
第 3 層 事實假設結論分層
問什麼:這一句是紀錄撐得住的事實、待查的假設,還是印證過的結論
產出:分成三層寫的分析稿,每一句看得出背後有幾分證據
↓ 結論撐得住,才問這套做法該不該用
第 4 層 技術評估與治理
問什麼:解決哪個業務問題、有沒有法源、資料可不可靠、怎麼防濫用、停用怎麼收
產出:五題各自的答案、人工覆核的位置、退場時的資料處理方式
圖示對應上方五層,只是概念示意,不代表任何實際系統或作業流程。
**重點:**資料整合這天疊成五層:第 0 層先讓工具閉嘴,困難是資料不足、流程延遲、資訊不一致還是判斷依據不清,太早選工具、後面每層都變成配合工具的解釋;第 1 層刻意先不整合,六個角度的查證地圖把每筆資料的限制留在原地——帳號不等於使用者、位置多半是範圍、金流說不了決策;第 2 層整合五步每步都要留痕跡,標準化像清資料、交叉驗證像拿另一組來源當斷言,最容易漏的是最後一步的限制;第 3 層事實、假設、結論分層寫,假設滑成結論常只差幾個字;第 4 層能不能做只是第一題,後面五題才決定要不要用,維運與退出最容易被略過。整條換到別人能自己驗一次,代價是慢;難的是語意而非格式,兩個欄位同名,背後可能是不同時間範圍與蒐集目的。
往下追問:兩個欄位名字一樣、定義卻不同時,用什麼標準決定接不接,為什麼?假設那層要幾份獨立來源印證才升格成結論,門檻由誰定?
今日結論
我對「資料整合」的想像被改掉了。連起來只是動作,花時間的是替每條關聯記住它從哪來、有哪些話不能講,還要讓別人能自己驗一次。
我的反思
讓我卡住的是 《個人資料保護法》第 5 條 的「必要」與「正當合理關聯」。字面很短,配著公務機關蒐集、利用個資的 第 15、16 條 一起讀才知道管得多細:每多接一份資料,就多一組要交代的問題——目的、誰能看、正確性誰負責、放到什麼時候。分析結果若沒標出來源限制,看的人反而更容易高估它。
現在拿到新工具,我習慣先擺回四格:解決哪個業務問題、輸入資料夠不夠可靠、結果有沒有人工覆核的位置、出錯時誰能更正跟負責。第四格最常卡住,責任歸屬不會寫在說明書裡。
還有一個慢慢浮現的感覺:資料整合的難點常常在語意,格式反而好處理。兩個欄位名字一樣,背後可能是不同的時間範圍、不同的蒐集目的、不同的品質條件。所以做關聯分析前我會先確認定義、來源和更新邏輯。只是定義文件常常不完整或早就過期,這種情況要用什麼標準決定「能不能接」,我還沒想到好辦法。
法規與官方來源
- 法規與官方來源索引:回查個人資料保護、比例原則與資料治理的官方依據。