區塊勢

Scale AI 的護城河,
不只是一群標註員

資料工作、評估與人機協作,正在變成 AI 系統從 demo 走向可靠運作的營運層。

來源:Lightcone Podcast〈Alexandr Wang: Building Scale AI…〉|原始發表日期:2025 年 6 月 18 日

PART 1|起點

先把模型看不懂的世界,變成可工作的資料

Alexandr Wang 說,Scale AI 的起點很樸素:讓機器學習團隊更快取得可用的標註資料。但真正難題不是把任務丟給一群人,而是把雜亂的真實世界轉成可以反覆檢查、回饋與改進的資料流程。

自駕、企業工作流與國防情境都會遇到同一件事:模型輸出看起來合理,不代表在邊緣案例裡可靠。當資料分布改變、輸入不完整或成本必須受控,團隊需要的不只是更多資料,而是知道哪一種資料、哪一項失敗、哪一個評估最值得優先處理。

Scale 的訪談主張不是「人會被 AI 取代」,而是高品質的人類判斷、資料與回饋迴路會留在系統裡,改變它被使用的方式。

PART 2|評估

沒有難題的 benchmark,會把進步看錯

訪談把 evaluation 放到中心。Wang 認為,AI 產業缺少足夠困難、能辨識前沿能力差異的測試。模型在容易的題目上表現很好,並不能告訴團隊它在長流程、模糊目標、真實工具操作與高風險決策上是否可靠。

任務

先定義使用者真的想完成什麼。

證據

把成功、失敗與不確定性留下來。

迴路

用新資料和評估回寫系統。

這讓「模型能力」變成一個營運問題。評估不是發表會上的排名,而是團隊決定何時能放權、何時要人工覆核、又該把下一筆預算花在哪裡的依據。

PART 3|agents

代理人帶來的不是自動化,而是新的責任邊界

談到 agentic workflows,Wang 沒有把它描述成按下按鈕就能無人運作的魔法。代理人可以把資訊搜尋、工具呼叫與多步驟任務串起來,但越接近真實工作,越需要清楚的權限、可回溯紀錄與人類升級路徑。

因此,能否讓 agent 上線,取決於系統是否能回答三個問題:它根據什麼做決定?失敗時誰能發現?發現後誰能改正?這些問題把資料品質、評估設計與工作責任重新接在一起。

PART 4|競爭

競爭不是只比模型,也比能否把能力接進現實

訪談也談到中國 AI 實驗室與硬科技競爭,但沒有把它縮成單一排名。模型、算力、資料、人才與部署場景彼此牽動。Scale 的位置正好說明,AI 的競爭不只在訓練出哪個模型,也在於誰能把模型放進企業、公共部門與複雜流程,仍保持可驗證與可改進。

這是訪談中的界線:受訪者對產業與競爭的描述是其觀點;哪些部署能安全擴大、哪些能力已被獨立證實,仍須以個別證據與實測判斷。

「可靠的 AI,不是一次回答得漂亮;而是能在真實工作裡被測、被追問,也被修正。」

你會先補哪一塊?

選一個你認為最容易被 AI 團隊低估的工作。

你的觀點

想看原始訪談?

回到 Lightcone 的完整訪談,可核對受訪者對 Scale、評估、agents 與競爭的原始脈絡。

閱讀完整文章 →

區塊勢每週深入拆解一個
你該知道的科技趨勢