PII 偵測實測 : Regex vs BERT-NER vs Ensemble
PII 偵測三路對比:Regex vs BERT-NER vs Ensemble 在 9 個醫療與商業場景的實測 要替 LLM pipeline 加 PII 偵測,最常見的問題是:規則式(Regex)夠不夠用?BERT-NER 能補什麼?這次我們拿 9 個測試案例(商業合約、HR 記錄、程式碼審查、EMR 出院摘要、VCF 基因報告、放射科報告,加上 3 種混淆格式的 PII)做了三路比較。結果是:Ensemble 拿到最高平均 F1 = 0.662,BERT-NER 單獨跑反而只有 0.167——在醫療文本上幾乎全滅。 這份報告記錄了 2026 年 4 月底的實測數據,適合正在為醫療 AI pipeline 選 PII 偵測方案的工程師。 三個方法的設計邏輯 M1 Regex(純規則):手刻台灣電話格式(09XX-XXX-XXX)、電子郵件、身分證(A123456789)、日期(YYYY-MM-DD)、健保碼、MRN 格式。設計上只抓格式特徵,不需要語意理解。延遲幾乎是零(<0.3ms/筆)。 M2 BERT-NER(dslim/bert-bas...
Original Source
Read the full article at Dev →KhanList aggregates and links to publicly available news content. We do not host full articles from third-party sources. Always verify important information with original sources.