← 返回議題
所屬議題: 2026審議大會:AI時代的風險評估- AI生成兒少不宜內容說明頁已發布
thorn-safety-by-design-for-generative-AI
中立《Safety by Design for Generative AI》報告摘要
一、現狀分析
本報告由 Thorn 與 All Tech Is Human 推動,旨在提出科技業者可以立即執行的兒少安全措施。其核心判斷是:生成式AI已降低製作與大量散布兒童性虐待素材(AIG-CSAM)的技術門檻,現行以事後刪除為主的治理方式不足,必須將兒少安全納入模型的開發、部署與維護全生命週期。此要求同時適用於封閉模型、開放模型及公開流通的模型權重。
生成式AI造成四項主要風險。第一,大量合成內容增加執法人員辨識真實受害兒童的負擔。第二,普通兒童照片可被性化,既有受害者影像亦可經微調產生更多素材,形成新的受害與再受害。第三,生成成本降低,使行為人誤認合成內容「沒有受害者」,並降低性化兒童的社會與技術障礙。第四,文字及影像模型可提供誘騙、性勒索、規避偵查與掩滅證據的方法。報告承認AIG-CSAM目前占比仍低,但認為其已經發生且持續成長,不能等待危害擴大後再補救。
二、報告對技術措施的立場
報告明確支持「安全設計」,即以多層次措施降低模型被濫用的機會,而非依賴單一內容過濾器。
在開發階段,AI開發者應確認資料來源,排除高風險網站,使用雜湊比對、分類器及人工審查偵測、移除並依法通報CSAM;圖像、影音與聲音資料集原則上應避免同時包含兒童素材與成人性內容。模型開發過程須持續進行紅隊測試,並將發現的弱點回饋至訓練。生成內容則應預設加入浮水印或C2PA等來源資訊,以協助辨識內容是否由AI產生。
在部署階段,封閉服務應偵測輸入提示、上傳內容及模型輸出;提供即時檢舉功能,並對違規帳號採取限制或停權。模型上架前應接受兒少安全評估,可採分階段發布,並在模型卡中說明訓練資料、測試結果、限制及已採取的安全措施。模型託管平台不得只接受開發者自行聲明,而應逐步建立第三方模型的標準化及自動化評估。
在維護階段,平台須持續更新分類器與安全措施,移除專門生成AIG-CSAM的模型及「裸化」服務,重新評估既有模型,並從社群平台與搜尋結果中阻斷相關工具。報告亦支持研究防止兒童照片遭AI修改的技術,例如在上傳時加入不易察覺的擾動。
報告不認為技術措施完全可靠。資料清理可能降低正常模型能力;自動偵測可能具有文化與人口偏誤,也會產生誤判。因此,涉及通報、下架或停權的決定應保留人工審查及申訴機制,並為內容審查與紅隊人員提供心理支持。
三、不同利害關係人的行動
AI開發者負責資料治理、紅隊測試、來源標記及模型安全更新;不能將責任全部推給終端使用者。
AI模型與資料託管平台應在上架前及上架後評估模型與資料集,拒絕或移除高風險模型,並要求開發者提供兒少安全資訊。
社群平台與搜尋引擎應偵測、下架及降低違法內容與「裸化」工具的可見度,防止服務成為散布與取得工具的入口。
政府、執法機關、NGO及被害人支持組織應建立合法通報、資料保存及跨組織合作機制,提供安全測試的法律界線、執法需求及受害者觀點。
四、結論
報告的立場不是禁止生成式AI,而是要求掌握技術與基礎設施者依其控制能力承擔責任。最有效的治理順序是:先避免危險資料進入模型,再於發布前測試與限制能力,最後持續偵測、移除及更新防護。單靠使用規範、使用者自律或事後下架,均不足以保護兒童。
建立於 2026/8/17 · 1 人貢獻 · 提交者:Thompson Lin
可分享這份素材的獨立連結