跳至主要內容
軟體工程 · AI 系統 · 注重隱私 · 依據證據

我用 AI 協作打造經得起驗證的軟體系統。

從裝置端媒體、智慧合約安全工具,到本機 AI 工作流程,我把產品想法轉化成重視隱私、可測試、可驗證的系統。

62/62
單元測試通過
EchoReel 原生 iOS 測試組
50 組合約
安全基準測試
SCSA Slither50 評估矩陣
160/160
長時間浸泡任務驗證
VoiceFlow 守護程序監控
所有主張皆可追溯至專案真實證據。
完整精確率、召回率與記憶體指標詳見各案例 →
核心工程主張
「AI 加速迭代。信任來自明確的界限、可重現的證據,以及勇於淘汰不合格方案的工程紀律。」
預設拒絕(Fail-closed)生物特徵資料零雲端外傳誠實揭露負向實驗結果
01精選技術案例

EchoReel

裝置端照片回憶系統,身份判斷由人掌控。

核心原則

「AI 提出候選,人決定身份。」

面臨問題

商用雲端相片服務常將家庭照片上傳至遠端伺服器進行分析,並依據不透明的相似度門檻自動合併人物身份。EchoReel 在零網路權限的前提下,完全於裝置端執行所有索引與照片回憶編排。

架構決策

架構強制實施 Actor 隔離界限:Apple Vision 與本機分群僅能提出候選結果。AI 嚴格禁止在未經使用者於 SwiftUI 審查佇列點擊確認的情況下,直接寫入持久化的 SQLite 關聯圖譜。

測試組驗證
62/62 通過
3/3 模擬器完整流程
E1 記憶體門檻
0.215 MiB
上限預算:≤0.250 MiB/張
系統架構圖 · 資料流與信任界限

裝置端身份隔離管線

零網路外傳
01 PhotoKit

01. 本機讀取:PhotoKit Asset Reader 在零網路權限下將高解析度相片載入裝置端記憶體。

02 Vision

02. 裝置端偵測:Apple Vision 人臉特徵觀察器於本機提取人臉外框與臨時相似度特徵。

03 AI 提議

03. AI 提議:僅將候選相片分群彙整為未確認建議。強制邊界:AI 僅提議,人類做決策。

04 人工門檻人工確認

04. 強制人工門檻:SwiftUI 審查佇列要求使用者主動點擊確認,絕不允許自動連結身份。

05 SQLite 圖譜

05. 本機持久化:SQLite 儲存確認的身份與回憶關聯,嚴格維持在 0.215 MiB/張記憶體預算內。

06 AVFoundation

06. 影像合成:AVFoundation 影片渲染器直接利用硬體編碼輸出前景動態故事影片。

當前選取階段:01. 本機讀取:PhotoKit Asset Reader 在零網路權限下將高解析度相片載入裝置端記憶體。
評估門檻紀錄 · ECHOREEL-021
淘汰門檻 · 未予升級
候選模型/產物
候選人臉特徵嵌入模型
驗收門檻
Recall@50 ≥ 0.850000
實測數據
0.585117 (-0.264883)
淘汰決策: 自動分群候選模型未達到精確率與召回率門檻。為避免在使用者相簿中產生錯誤的人物合併,此模型被明確淘汰並捨棄。最終出貨架構保留 Apple Vision 原生人臉偵測特徵,並結合手動確認機制。
02精選技術案例
可追溯架構 · 證據圖譜與信任界限

確定性初篩與受約束解釋機制

本機編譯預設拒絕
01 原始碼匯入

01. 安全匯入:防範路徑遍歷與惡意腳本,本機編譯器預設拒絕(fail-closed),安全暫存未受信任的 Solidity 原始碼。

02 Slither 語法樹

02. 語法樹分析:執行 27 項已對應的靜態偵測器,產出可嚴格驗證的 AST 程式碼區段與呼叫圖譜。

03 缺失正規化

03. 規則正規化:將異質的分析器輸出對應至統一結構,標註 CWE/SWC 標準識別碼。

04 證據圖譜事實錨點

04. 證據圖譜:將驗證後的漏洞事實與合約關係持久化至 SQLite,作為不可竄改的事實驗證節點。

05 受約束 LLM

05. 受約束解釋:LLM 僅能在 SQLite 證據節點的嚴格邊界內生成解說與修復建議,絕不捏造漏洞。

當前選取階段:01. 安全匯入:防範路徑遍歷與惡意腳本,本機編譯器預設拒絕(fail-closed),安全暫存未受信任的 Solidity 原始碼。
評估門檻紀錄 · SCSA-BENCH-02
已測量局限 · 4 起誤報
候選模型/產物
Slither50 v2 自動化初篩矩陣
驗收門檻
零漏報(召回率 100.00%)
實測數據
25 TP · 21 TN · 4 FP · 0 FN
局限性界限: 基準測試在重入攻擊與 delegatecall 偵測中記錄了 4 起誤報。本系統定位與設計為開發者初篩輔助工具,絕非自動化安全認證,亦不可取代形式化驗證與人工審計。

智慧合約安全初篩系統

以確定性分析結果為依據的 Solidity 安全初篩系統,AI 只負責解釋證據,不負責創造漏洞事實。

核心原則

「確定性靜態分析器擁有漏洞事實。LLM 僅負責解釋與提供修復建議。」

面臨問題

生成式 LLM 容易捏造不存在的漏洞或遺漏微妙的狀態機邏輯缺陷。審查團隊需要快速的初篩輔助,但絕不能將模型的文字自信誤認為嚴謹的數學安全證明。

架構決策

本機編譯建構預設拒絕(fail-closed)。分析流程執行 27 項已對應的 Slither AST 偵測規則,將缺失正規化存入本機 SQLite 證據圖譜,並嚴格限制生成模型僅能解釋既有的證據節點。

測試組覆蓋
175 項通過
140 pytest + 35 Vitest
Slither50 v2 基準測試
100% 召回率
86.21% 精確率 · F1 92.59%
03精選技術案例

VoiceFlow

本機 macOS 語音工作流程,高風險操作必須經過明確確認,模型也必須通過產品層級驗證才能升級。

核心原則

「禁止未經核准的外部副作用。模糊意圖一律預設拒絕。」

面臨問題

語音 Agent 在執行系統層級指令時,若語音辨識出錯極易引發災難性的誤操作。此外,將環境收音持續串流至雲端 API 會嚴重侵犯桌面隱私。

架構決策

系統架構透過確認狀態機嚴格隔離執行層:唯讀查詢立即執行;具狀態變更之操作(刪除檔案、外發貼文、執行腳本)則攔截於實體確認屏障。獨立的守護程序可在背景 Worker 異常時於 0.43 秒內自動恢復。

8 小時浸泡測試
160/160 通過
0.12 MB/hr 記憶體斜率
安全性基準測試
0 起自動提交
高風險操作零未授權執行
防故障指令管線 · 外部副作用確認屏障

本機語音意圖至可驗證 macOS 執行流程

0.43s 守護程序恢復
01 語音擷取

01. 按鍵發話:透過 Carbon 熱鍵攔截收音,16kHz PCM 音訊直接送入本機記憶體,完全不經雲端。

02 本機 STT

02. 本機語音轉文字:使用 faster-whisper int8 CPU 推論,於中位數 2,003ms 內完成轉錄,零對外網路連線。

03 文本正規化

03. 繁體中文正規化:比對專業詞庫過濾模型幻覺,將口語慣用語標準化為精確的系統指令。

04 意圖分派器

04. 意圖狀態機:將指令嚴格劃分為唯讀查詢與狀態變更操作(B7 基準測試成功率 1.0000)。

05 安全確認門檻確認屏障

05. 外部副作用確認門檻:任何狀態變更操作必須經由實體視窗確認(160 次浸泡測試中 0 起自動提交)。

06 執行與稽核

06. 沙盒執行與加密軌跡:沙盒轉接器執行已確認指令,背景守護程序 0.43s 恢復,稽核日誌經 AES-GCM 加密存於 SQLite。

當前選取階段:01. 按鍵發話:透過 Carbon 熱鍵攔截收音,16kHz PCM 音訊直接送入本機記憶體,完全不經雲端。
評估門檻紀錄 · VF-STT-03
淘汰門檻 · 未予升級
候選模型/產物
微調版 Whisper int8 模型(CTranslate2)
驗收門檻
相對 WER 改善 > 10% 且指令準確率 ≥ 0.90
實測數據
WER +0.019188 · Action +0.0727
淘汰決策: 儘管模型量化與載入完全成功,實際指令測試顯示準確率僅微幅提升 (+0.0727),且量化雜訊導致指令邊界解析異常。此候選模型被正式淘汰;出貨版本維持基礎模型並搭配正規化規則過濾。
工程方法論

工程實踐流程

從不變量定義到經驗驗證的五階段工程推進方法。

01階段

DEFINE

在開始編寫程式前,明確界定系統限制、核心不變量與可量測之驗收門檻。

產物:不變量合約(Invariant Contracts)
02階段

ARCHITECT

設計威脅邊界、隱私防護模型、Actor 並行架構與嚴格的 Schema 規格。

產物:系統架構綱要(System Schemas)
03核心推進中

BUILD

監督 AI 開發工具生成具備型別定義的模組、資料庫遷移與整合管線。

產物:已驗證程式庫(Verified Codebase)
04階段

VERIFY

執行自動化測試組、迴歸測試、記憶體分析與對抗性安全檢查。

產物:可重現測試紀錄(Reproducible Runs)
05階段

ITERATE

評估升級門檻(Promotion Gate)。誠實淘汰未達標的模型,優化已證實的路徑。

產物:決策與淘汰紀錄(Gate Decision Log)
次要研究與基準測試紀錄

研究與實驗紀錄

探索 Agent 治理、本機系統運行環境行為與可重現評估體系的工程紀律實踐。

次要研究紀錄,具備明確的系統界限與透明的終止條件。

EXP-01PAUSED RESEARCH

GovernSeed: 可驗證 Agent 治理契約

以本機不變量契約與預設拒絕門檻約束的 Agent 協作治理體系。

不變量契約預設拒絕門檻Agent 工作流離線驗證
01 · 研究問題

AI 協作開發能否透過機器可驗證的本機契約與預設拒絕門檻,達成嚴謹的工程治理?

02 · 實作與驗證內容

建立形式化治理契約 Schema、離線驗證器與自動化門檻檢核機制,限制多 Agent 在嚴格的程式碼倉儲邊界內運作。

03 · 實證與度量結果

R1 階段門檻在 12 次迭代測試中,成功攔截所有未授權的跨模組引用與無約束外部副作用。

04 · 邊界限制與終止條件

研究推進至 R2 階段時於門檻 G2 正式終止:實證數據不足以證明在缺乏人工逐行審查規格的前提下能完全杜絕語意漂移。當證據不足以支撐假設時,依紀律終止研究。

05 · 工程洞察與收穫

治理契約絕不能依賴 Agent 自我回報;評估門檻必須維持完全獨立、確定性且預設拒絕。

EXP-02RESEARCH LAB

Selfhosted Lab: 本機容器與在地化評估

30 套本機 Docker 自託管系統之架構比較、資源開銷與繁體中文在地化驗證。

30 套系統評估Docker Compose繁體中文在地化資源分析
01 · 研究問題

各類開源自託管系統在隔離本機容器與嚴格繁體中文在地化環境下的運行表現與差異為何?

02 · 實作與驗證內容

標準化 30 套開源服務的本機容器部署配置、zh-TW 語系檔相容性檢驗與容器健康檢查探針。

03 · 實證與度量結果

完成 30 套系統之閒置記憶體剖析(42 MB 至 1.8 GB)、指出 14 款工具的在地化缺失,並彙整資料庫冷啟動行為。

04 · 邊界限制與終止條件

僅限本機 localhost 驗證。外部 SMTP 遞送、生產環境 DNS、多租戶認證與雲端擴展性未納入認證範疇。金鑰、憑證與即時資料嚴格排除公開。

05 · 工程洞察與收穫

容器重現性高度依賴具體版本標籤與隔離資料卷;在地化完整度與專案知名度無必然關聯。

EXP-03PAUSED RESEARCH

OSS Benchmark V3/V4: 可重現 Agent 基準測試

以封閉初始狀態、獨立判讀器與執行器沙盒構建的 Agent 基準測試工程體系。

封閉起點狀態獨立判讀器沙盒隔離審查零虛構結論
01 · 研究問題

能否在完全杜絕環境狀態污染的前提下,以獨立客觀判讀器評估 Agent 在複雜軟體任務的表現?

02 · 實作與驗證內容

構建不可篡改測試環境、初始工作區雜湊封裝、嚴格 Schema 任務定義,以及與 LLM 上下文完全解耦的外部獨立判讀器。

03 · 實證與度量結果

V3 驗證了 40 項基準任務的確定性執行。V4 進一步導入系統資源 cgroups 與自動化環境清理審查。

04 · 邊界限制與終止條件

V4 試行階段於執行前主動叫停:Linux cgroup 在特定核心邊界下的清理隔離無法獲得嚴密保證。在試行執行次數為 0 的情況下,絕不宣稱任何處理效應。

05 · 工程洞察與收穫

基準測試的公信力源於嚴謹的對照控制;公開 0 次執行的沙盒停工決策,遠勝過發布受污染的效能數據。