フィジカルAI

機器人才是Jev的舞台|夾在運動與規劃之間的判斷層

發布2026-09-20濱本 隆太

機器人的控制是一層一層疊起來的。伺服約1000Hz、VLA 5〜50Hz、任務規劃不到1Hz。夾在中間的那一層只要「挑出下一個動作」就好,而我們現在不是塞滿條件分支,就是放一個寫字寫到來不及的大型語言模型。不寫文章的Jev,正好是為這一層做的零件。本文從Jev的基礎講起,寫到接進機器人的設計圖,以及安全該切在哪裡。

機器人才是Jev的舞台|夾在運動與規劃之間的判斷層
分享

大家好,我是TIMEWELL的濱本。

把機器人真的放進產線的人,大概都撞過這面牆。動作本身做得出來,難的是決定「現在要做哪一個」。

站在料架前的手臂:要夾、要重新定位,還是因為有人走進來所以先等。搬運機器人到了轉角:要轉,還是直走繞過去。這些動作,既有的規劃器和控制器都做得出來。真正會失控的是「挑哪一個」——條件分支愈長愈沒人敢碰。改放大型語言模型進去,換另一種死法:它花好幾秒在寫句子,機器人杵在原地。

2026年9月15日(美國時間)發表的TypeSafe AI「Jev」,正好是為這一層做的零件12。它一行文章都不寫,只從你定義的選項裡挑一個,附上機率。就這樣而已。

先講結論。

  • 機器人的控制分層:伺服約1000Hz、VLA 5〜50Hz、任務規劃不到1Hz。Jev落在2〜14Hz這一層
  • Jev不能吃圖片,所以感知留在上游,送進Jev的只有寫成文字的狀態
  • 選項有限、狀態寫得出文字、想一次問幾十個判斷——這三件事湊齊時,這個形狀最順
  • 輸出免費,所以判斷的成本等於消失。每秒10次也才每小時7美元
  • 但是絕對不能拿來做安全功能。照格式答,和答得對,是兩回事

Jev到底做什麼

先從頭講,沒有背景的讀者也能跟上。

對話型AI是用文章回答你。問它「這個零件該夾嗎」,它會客氣地回「是的,對象位置穩定,建議夾取」。但驅動機器人的程式要的不是這句話,**它要的是「夾」這個選擇,加上一個表示有多確定的數字。**用文章回覆,程式還得再解讀一次、轉成能分支的形式,而且它是一個字一個字寫出來的,很慢。

Jev一開始就把這道工序拿掉。送進去的是「描述狀況的文字」和「想問的問題」。問題只有三種3

Choice 從清單裡挑一個。定義好 grasp(夾)、reposition(重新定位)、wait(等待),它會回其中一個,並附上每個選項的機率和整體的信心值。

Score 依你自訂的尺度給分。定義「不穩」「勉強」「穩定」三級,回來的可能是1.3這種落在級與級之間的值。

Noul 回傳某個敘述為真的機率,0到1。寫「對象在夾取範圍內」,回來0.87。實務上這一種最好用。

有兩個性質對機器人特別重要。第一,一次呼叫可以混進幾十個不同類型的問題,而且是平行評估3,問題變多,等待時間幾乎不變。第二,輸出免費。輸入每百萬token 0.042美元,輸出完全不計費4,因為根本沒有「寫」這道工序可以計費。

TypeSafe AI把這類模型稱為System One,名字取自康納曼所說的「快而直覺的思考」。官方文件寫得很直接:這類模型「不寫回覆、不產生程式碼,也不產生推理過程的說明」5

在進入機器人的話題前,有一個限制要先講。**Jev只吃文字。**官方文件明寫「僅支援文字輸入,圖片、聲音、影片尚未支援」5。這看起來是缺點,實際上反而讓架構更乾淨,後面會講。

另外,我們自己量過它的中日文實力。對自家1,852篇日文文章問一個真偽問題,門檻0.20時精確率96.4%、召回率87.9%;改成從九個分類挑一個,只有36%和我們的標籤一致6與其用多選硬猜,不如把真偽問題並排問——這一條在設計機器人的判斷時同樣成立。

機器人的控制是一層一層的

這是本文的重點。大家講「在機器人裡放AI」講得像機器人只有一個東西,實際上它是一疊週期不同的迴圈,每一層該放的工具都不一樣。

最底下是伺服控制,追關節角度與電流,工業機器人約1000Hz,也就是1毫秒一次。這是決定論式控制律的世界,回傳機率的模型沒有位置。

往上是軌跡生成與運動規劃,從這個姿勢繞過障礙到那個姿勢,數十到數百Hz。

再往上,就是現在發展最快的VLA(Vision-Language-Action)模型那一層:吃相機影像和語言指令,直接輸出機器人的動作。開源的OpenVLA推論約3〜5Hz,就算用A100這種GPU,單步動作生成也要0.33秒7。用平行解碼與動作分塊加速後的OpenVLA-OFT+可達77.9Hz,Physical Intelligence的π0最高到50Hz89這一層正在比頻率。

最上面是任務規劃:「從料架取件、放到檢查台、不良品丟紅箱」這種流程,低於1Hz。大型語言模型進來的就是這一層。

**Jev落在VLA與任務規劃之間。**回應70〜500毫秒1,也就是2〜14Hz。要生成連續動作太慢,要想整段流程又太快。而夾在中間的,剛好是條件分支長得最兇的那一層。

把那一層在做的事講成白話:面對當下的狀況,從備好的行為裡挑一個啟動;然後決定要繼續、叫人、還是停下來。就是Choice和Noul。

為什麼這麼合

四個理由。

**第一,機器人的行為本來就是離散的。**生成式模型的長處是「要產出什麼」有無限自由度的工作;機器人下一步要做的,幾乎都是一張有限清單——夾、放、靠近、退開、等待、叫人。「從有限選項挑一個」就是Choice本身。不必繞去一個無限自由度的模型再寫解析器。

**第二,機器人的狀態本來就是數字和符號。**關節角、力覺值、偵測到的物件清單與座標、電量、上一次失敗幾次。這些全部寫得出文字。「不能吃圖片」這件事在這裡幾乎不痛,反而逼你明確決定「影像轉文字」要在哪裡做,架構更誠實。

發表後公開的實作把這點示範得很好。Milind S的桌面自動化完全不把螢幕截圖送出去:Mac上的小型影像模型切出畫面元件,裝置內的OCR讀出標籤,只把那些字串送給Jev。回傳每個元件的機率,點最高的,再重新偵測。他說一次判斷約90毫秒10。機器人版的結構一模一樣:感知把感測器變成物件清單,送出去的是清單。

**第三,平行問幾十個問題,等待時間幾乎不變。**這點在機器人身上最有感。每一次判斷,其實都有一堆事情想確認:對象在夾取範圍內嗎、有人要進來嗎、是不是在重複同一種失敗、夾取姿勢穩不穩、電量撐得完這個動作嗎、有沒有超出節拍時間。

分階段問,問愈多愈慢。Jev可以一次全部塞進去,回應時間幾乎不變。**別再設計「先判斷急不急,急的再往下問」,把想問的一次問完,組合交給程式決定。**官方的設計指引也是同一句話的反面:「程式負責確定性的處理並掌握流程,模型只出現在需要常識判斷、或需要解讀非結構化資料的地方」11。寫過機器人控制的人看到這句,大概只會覺得這是常識。

**第四,回傳機率與信心值,所以停得下來。**這也許是最大的理由。機器人錯了會弄壞東西、會傷到人,所以「不確定就停」是設計的核心。Jev回傳每個選項的機率與整體信心值,官方建議的是三段式運用:信心高就自動執行,中等要謹慎,低的話「不要執行,轉給人、請對方補充,或退回另一套機制」12

這三段可以直接搬到機器人的運轉上。信心高就正常速度執行;中等就降速執行並留下紀錄;低就停下來叫人。**正因為是把判斷自動化的工具,才更要先畫好停下來的那條線。**從大型語言模型的自由文字裡讀出「它好像沒把握」,遠比拿到一個數字難用。

在找 AI 訓練與顧問服務嗎?

請參考我們整理的 WARP 課程與顧問服務內容。

發表後的實作告訴我們什麼

挑四個能換算到機器人的。數字都是發表者自己條件下的報告值。

**每秒10次的判斷撐得住。**TypeSafe AI自己的發表示範,把Doom的遊戲狀態變成結構化文字送出,回傳下一個動作。官方部落格寫每秒約10次呼叫、每小時約7美元;也寫明輸入不是圖片,而且「不用AI的傳統Doom機器人有時玩得更好」13。願意在自家宣傳示範上主動加註保留的廠商,我比較信得過。每秒10次,對移動機器人的行為選擇綽綽有餘。

**330毫秒的節奏不會斷。**atomic.chat的團隊讓它在火箭落下的盤面上每330毫秒挑一格安全的,26次活了25次14。單次判斷再簡單,能不能每秒三次、不中斷地持續,是另一回事。這就是「監視接到閃避」的形狀。

**把即時反應和規劃拆給不同模型。**Wuyang Zhou把Jev和OpenAI的GPT-6 Astra組起來玩Minecraft,突發狀況由Jev即時反應,大目標由Astra提前規劃15我認為這才是機器人的本命形狀:任務規劃交給大模型、行為選擇交給Jev、動作生成交給VLA或傳統控制。每一層放不同的工具。

每秒4次選路徑。有人做了瀏覽器上的駕駛模擬器,把車道邊界、周圍車輛、號誌整理成表送進去,從候選路徑挑一條,在轉彎與有車流時每秒最多4次。緊急煞車由另一套機制負責16。這不是實車,也不是安全性的證明。但把緊急停止放在模型之外,方向是對的。

現在那一層放的是什麼

為了把Jev的位置講清楚,看一下現在大家在那一層放什麼。大致三種。

**第一種,全部用條件分支寫。**最常見。快、行為完全可預期、可驗證。問題是遇到沒想到的狀況就什麼都做不了,而且條件愈長愈沒人敢碰。現場改幾次、過個三年,就會出現「這個 if 不知道誰加的,但刪掉就會停」的一團。

**第二種,放大型語言模型。**2024年以後,任務規劃那一層確實進來了。彈性很好,但放到行為選擇那一層會有兩個痛點:它要寫字所以慢;而且回的是自由文字,程式端得寫一個解析器,把「應該可以夾吧」轉成 grasp,還得長期維護它。

**第三種,用學習整層換掉。**也就是VLA的方向。成了很強,但只想改行為選擇時也得跑一輪訓練,「從今天起有人靠近就等待」這種改動沒辦法當天生效。

Jev夾在這三者之間。**像分支一樣快、像語言模型一樣有彈性、而且改一句問題就能改行為,不用重新訓練。**代價是它不產生動作、也看不到圖片。能力窄,但位置很明確。

用會影響決策的單位算費用

機器人是連續運轉的,所以「一次多少錢」沒有意義,要算「一天多少錢」。

官方的Doom示範是每秒約10次、每小時約7美元13,而且每次都把整個遊戲狀態送出去。工業上的行為選擇很少需要每秒10次。假設每秒2次、一天8小時,就是57,600次;每次狀態幾百字的話,依價目表換算大約0.3美元4一台機器人一天幾十日圓。

這帶來的不是速度,而是你不會再為了省錢而跳過檢查。不用再妥協成「每次全查太慢太貴,改成三次查一次」。再加上「多問問題幾乎不影響等待時間」的性質,每一輪都把想確認的全部確認一遍就變成可行的設計。對安全和品質來說,這個轉變不小。

當然,變便宜的只有判斷本身。相機、物件偵測、OCR、點雲處理的計算成本要另外算。請看總額。

接進機器人的設計圖

具體來說,分四層。

感知層。相機、深度、力覺、編碼器。不歸Jev管。物件偵測、姿態估計、OCR、點雲。輸出是結構化文字

對象: 螺栓 M6 / 位置 (x=0.42, y=-0.11, z=0.08) / 傾斜 12度
夾取範圍: 內
周圍人員: 1人 距離1.8m 接近中
前次嘗試: 失敗2次(滑脫)
電量: 41%
節拍: 超出預定 38 秒

送進Jev的就是這個字串。沒有圖片,也不需要。

**判斷層。**這裡是Jev。把問題綁成一束送出去:

action   : Choice「下一個要執行哪一個」
           grasp / reposition / wait_for_human / call_operator / abort
stable   : Noul「對象的姿態穩定到可以夾取」
human    : Noul「有人正要進入作業範圍」
repeat   : Noul「正在重複同一個原因的失敗」
urgency  : Score「這個狀況的急迫度」3級

回來的是選擇、機率和信心值。**最後機器人怎麼動,是程式決定的,不是Jev。**例如:human 超過0.6,不管 action 是什麼都改成等待;repeat 超過0.7,就換一種夾取策略。門檻用常數集中在一個地方,要改就走程式碼審查——這和官方手冊建議的形狀一致11

**執行層。**啟動既有的運動規劃與控制器。完全照舊,Jev不碰。

安全層。下一節講,而且和上面三層獨立

這個結構我最喜歡的一點是:拿掉Jev它照樣會動。把判斷層換成固定規則,就退回傳統的狀態機。**加了會變好,拿掉不會壞。**要引進新零件,我會把這一條當成必要條件。

四個會咬人的地方

**不能吃圖片。**只有文字5。指望「它會看著相機判斷」,設計就會崩。感知一定放在前面。反過來說,如果你的感知輸出寫不成文字,那Jev就不是你的工具。

算術和計數不行。官方公開了弱點:按字面解讀、不擅長算術與計數、日期大小比較不可靠、無關資訊一多準確度就掉17。距離、數量、時間差一律在程式裡算好,用數字送進去。不要叫它數到十。

**格式正確不等於答案正確。**官網寫「不會產生幻覺」,意思是不會吐出格式以外的值。Hacker News和The Register都指出「格式正確但內容錯誤」仍然可能發生18。守住選項清單,不代表挑對選項。這就是機率存在的理由。

日文和中文都不如英文。官方文件寫英文「是主要訓練語言,準確度也最好」,其他語言「可以處理但不對等,請先用自己的內容測過」4。如果機器人的狀態是用日文或中文寫的,先用自家資料量過門檻再說。我們的實測中,真偽問題在日文也到了96%的精確率,但預設的0.5門檻漏掉很多,降到0.2召回率才回到88%6。這種事猜不出來。

安全要放在獨立的系統上

這一段我講重一點。不要把Jev放進安全功能。

緊急停止、速度與力的限制、人員接近監視、護欄與光柵連動。這些都要放在任何機率模型之外,由獨立的安全系統負責。TypeSafe自己的手冊在講判定機制時就寫了「這是檢查,不是安全邊界」11

工業機器人的安全標準ISO 10218,在2025年1月第1部與第2部同時改版,是2011年版之後的大改。它把原本另立的ISO/TS 15066(協作應用)納進來,明確化機能安全的要求,並在與機器人安全相關的範圍內加入資安要求。第1部從50頁增加到95頁19

這個方向的意思是:就算機器人裝了AI,安全的地基還是用決定論的方式打。Jev只在安全系統保證的範圍內動作。可以讓Jev決定要不要減速,但速度上限要放在Jev之外;可以讓Jev決定有人接近時要不要停,但真正停下來的要是安全系統。這條線要一開始就畫,因為之後畫不回來。

在日本的現場,這件事為什麼重要

這個話題在日本會有感,是因為人手不足的現場,還留著大量的判斷分歧。

難以完全自動化的工序,幾乎都夾著「每次都有一點不一樣」的判斷:零件方向沒對齊、前一道工序的變異留下來、今天人比較多。想把這些全部寫成條件分支,會得到維護不了的程式;留一個人站在那裡,自動化的意義又打了折。

把這些「每次都有一點不一樣」的判斷,用便宜、快速、而且停得下來的方式補起來的零件,就是這次發表的意義。當成性能競賽來讀會覺得很小:不寫文章、不看圖片、也不會算。但在實體AI落到現場的這個階段,缺的往往不是感知也不是運動,而是夾在中間的判斷。

關於日本製造業如何靠實體AI翻身,我另外寫在日本的實體AI;Jev本身的用法,20個實作整理在初步篩選只花0.12美元。兩篇一起看,這篇的位置會更清楚。

貴公司的工序裡還留著多少判斷分歧、要交出去到哪裡、從哪裡收回給人,這是業務設計的問題,不是技術問題。想先量一下現在畫到哪裡,可以試試AI素養診斷

總結

機器人的控制是分層的,每一層該放的工具不一樣。伺服放決定論式控制律,動作生成放VLA或傳統規劃器,流程放大型語言模型。而夾在中間、只要挑出下一個動作的那一層,一直沒有專用的零件。

Jev正好落在那裡。選項有限、狀態寫得出文字、想平行問判斷、需要用信心值停下來——機器人四項全中。而且輸出免費,判斷的成本等於消失。

但是,圖片送不進去、不要叫它算數,而且絕對不能拿來做安全功能。守住這三點,它就是這週就能試的零件。

TIMEWELL以WARP提供AI導入與人才培育,而這一塊我們正朝AI機器人課程發展。把機器人放進現場,和決定要把多少判斷交給機器,現在已經不能分開談了。想一起盤點貴公司的工序裡哪一層該放哪一個工具,歡迎透過WARP的個別諮詢聊聊。

參考文獻

Footnotes

  1. Introducing System One Models and Jev(TypeSafe AI、Diogo Almeida)。System One模型的定義、回應時間70〜500毫秒、輸入0.042美元/百萬token與輸出免費、Doom示範(每秒約10次、約每小時7美元、輸入是結構化資料而非圖片、傳統機器人有時玩得更好)皆出自該篇(筆者譯) 2

  2. Diogo Almeida的發表貼文(2026年9月15日,美國時間)TypeSafe AI官方帳號的貼文(同日)。報導見The Register(2026年9月16日)

  3. Introduction(TypeSafe AI Docs)。三種問題、回傳值、一次呼叫可混用、平行評估 2

  4. Models(TypeSafe AI Docs,2026年9月19日取得)。jev-1.13.0、輸入0.042美元/百萬token、輸出免費、脈絡64k、僅限文字,英文為主要訓練語言、其他語言「可以處理但不對等」(筆者譯) 2 3

  5. System One(TypeSafe AI Docs)。原文 "System One models do not write replies, produce code, or generate explanations of their reasoning." 與 "Jev currently accepts text input only. It evaluates strings, JSON objects, and arrays of text. Images, audio, and video are not supported (yet)."(筆者譯) 2 3

  6. 本公司的實測(2026年9月19日至20日)。對 content/columns 底下的1,852篇日文文章,每篇送出標題、說明與正文開頭1,600字,對jev-latest一次問三個問題。耗時49秒(並行10),費用是依註5的價目表推估的0.12美元,非帳單金額。正解為各篇front matter的分類。真偽的精確率96.4%、召回率87.9%(門檻0.20)、九分類一致率36%、預設門檻0.5的召回率75.4% 2

  7. OpenVLA(GitHub)Fine-Tuning Vision-Language-Action Models(arXiv 2502.19645)。OpenVLA推論3〜5Hz、單步動作生成在NVIDIA A100上0.33秒、建議控制頻率5〜10Hz

  8. π0: A Vision-Language-Action Flow Model for General Robot Control(Physical Intelligence)arXiv 2410.24164。最高50Hz的動作分塊,推論時以50Hz執行

  9. OpenVLA-OFT(專案頁)。以平行解碼與動作分塊達到77.9Hz,動作生成快26倍、延遲降為三分之一

  10. Milind S的貼文(9月18日)。裝置內的影像模型加OCR把畫面轉成文字、一次判斷約90毫秒,為本人的報告值

  11. How to build with TypeSafe(TypeSafe AI Docs)Classifying RAG passages(TypeSafe AI Cookbooks)。原文 "Code handles deterministic work and owns the control flow…"、門檻以常數集中管理,以及 "Nothing here is a security boundary."(筆者譯) 2 3

  12. Confidence(TypeSafe AI Docs)。High自動執行、Medium謹慎、Low為 "Do not act. Route to a human, request clarification, or fall back to a different system."(筆者譯)

  13. 同註1(Doom示範)。貼文見Diogo Almeida(9月16日) 2

  14. atomic.chat的貼文(9月18日)。330毫秒的節奏、26次活25次、費用不到1美分皆為本人的報告值

  15. Wuyang Zhou的貼文(9月18日)

  16. Justin Schroeder的貼文(9月17日)儲存庫。瀏覽器駕駛模擬器中每秒最多4次判斷、緊急煞車由另一套機制負責,見儲存庫說明。不是實車,也不是安全性的證明

  17. Jev 1.13 jaggedness(TypeSafe AI Docs)。按字面解讀、算術與計數與日期比較的弱點、無關資訊使準確度下降

  18. Introducing System One Models and Jev(Hacker News,2026年9月)。「格式正確但值可能是錯的」的指出見該討論串,The Register(2026年9月16日)也有同樣保留

  19. ISO 10218-1:2025(ISO)ISO 10218-2:2025(ISO)Updated ISO 10218 FAQ(Association for Advancing Automation)。2025年1月第1部與第2部同時發行,為2011年版以來的大改版,納入ISO/TS 15066、明確化機能安全並加入資安要求,第1部由50頁增為95頁

本文在製作過程中使用了AI,並於發布前由人工查核一手資料並完成編輯。

正在考慮在組織內導入AI嗎?

由熟悉數位轉型與資料策略的顧問,為貴公司設計合適的AI導入計畫。第一次諮詢免費。

如果這篇文章對您有幫助,歡迎分享

分享

訂閱電子報

每週為您送上 AI 應用與出口管制的最新資訊

您登錄的電子郵件地址僅用於電子報寄送。

想更了解 フィジカルAI

我們整理了 フィジカルAI 的功能與導入案例。

相關文章