HARD FORK · 原始發布 2026 年 8 月 7 日

政府的 AI 規則
不公開,
誰來檢查它?

安全規則可以保密嗎?可以。但當規則決定模型要如何被評估、誰要遵守、出了問題誰負責,保密也會同時關掉公共檢查的入口。

來源:Hard Fork〈Inside the Government's Cryptic New A.I. Framework〉。本文整理主持人與來賓的討論;對框架內容本身,明確區分已公開資訊、節目轉述與仍未獨立確認的部分。完整原始逐字稿可由頁首「問 AI」取得。

PART 1

最奇怪的不是有框架,而是大眾看不到框架

這集 Hard Fork 的起點是一個資訊不對稱:節目稱白宮已完成一套針對前沿 AI 模型的測試/評估框架,部分大型美國 AI 公司收到私下說明,但文本沒有對外公開。這是節目對事件的描述,不是本文能自行驗證的完整規則內容。

主持人把問題講得很直白:當政府制定會影響模型部署與安全責任的規則,社會至少需要知道規則處理什麼風險、由誰判斷通過,以及能否對判斷提出質疑。否則「有在管」和「管得住、管得對」會被混成同一句話。

PART 2

安全與透明不是二選一,而是可被拆開的設計題

保密不必然等於壞治理。若框架涉及漏洞、攻擊能力或企業尚未公開的安全細節,完全公開可能帶來新風險。但這不代表所有內容都只能留在黑箱:評估目標、責任邊界、外部審查角色、申訴或更新程序,仍可以有不同層次的說明。

把「是否公開」拆成三個可討論的層次
原則
評估哪些風險?
程序
誰評、如何覆核?
敏感細節
哪些內容需受限?

PART 3

模型失控的新聞,不能直接變成已證實的風險比例

節目後段訪問獨立 AI 評估組織 METR 的 Chris Painter,討論近期被描述為 AI agent「失控」的事件。這些事件可作為風險研究的線索:模型在目標、工具、權限與環境交錯時,可能產生非預期行為。但單一示範、媒體報導或來賓判讀,不能自動推出所有 agent 的普遍失敗率。

較可靠的追問是:測試情境是什麼?模型獲得了哪些工具和權限?人類是否能中止?測試能否重現?若政府框架真以安全評估為目標,這些可重現、可比較的條件,會比一個籠統的「安全」標籤更重要。

PART 4

真正需要被治理的,是判斷可以回頭檢查

節目沒有提供未公開框架的原文,因此它不能替公眾判定框架充分與否。它提供的是一個治理問題:規則若只對被監管者可見,外部研究者、使用者與受影響的人要如何發現漏洞?反過來,若所有技術細節都攤開,是否又會傷害安全?

可行的中間路徑不是假裝沒有張力,而是留下可追蹤的紀錄:公開原則與版本、由獨立者檢視高風險測試、說明例外理由、在重大事件後重新檢討。這些機制不能保證 AI 安全,卻能讓安全主張不只是一句無法驗證的承諾。

「保密可以保護敏感細節;但不能取代讓公共權力接受檢查的理由與程序。」

你最希望 AI 評估框架先公開哪一層?

這不是測驗;選出你認為最能建立可檢查性的那一塊。

你的觀點

想回到原始討論?

觀看 Hard Fork 完整節目;其中包含對未公開框架、AI alignment 評估與當週科技新聞的原始討論。這不是官方政策文本。

閱讀完整文章 →