大家好,我是TIMEWELL的濱本。2026年9月10日,理光日本(Ricoh Japan)宣布在「RICOH地端LLM入門套件」中搭載開源AI代理「Hermes Agent」1。日本的大型廠商把別人的開源代理直接裝進自家產品出售,這在一年前很難想像。Hermes Agent在GitHub上的星數已超過24萬,fork超過5萬2。上一篇降低AI程式代理成本的五種做法裡,我把Hermes Agent形容為「已經達到在文件中寫明沙箱與禁止寫入路徑的水準」的開源代理。這篇是續集,從實際在自己的電腦上跑起來開始寫。
讀者設定是兩種人:不是工程師、但想在自己的電腦上試試AI代理的人;以及被資訊部門問「開源的代理可以在公司內用嗎」卻答不上來的人。背後的模型,以Kimi K3、DeepSeek V4、GLM 5.3這類開放權重模型、透過Fireworks AI這種推論服務使用的組合為主軸。理由有兩個:便宜,而且模型可以換。不過一旦加上「安全」這個條件,就有幾個非設定不可的項目。跳過這一段的文章太多了,所以本文把最多篇幅放在設定上。
摘要:Hermes Agent是Nous Research公開的MIT授權、會自我改進的AI代理。一行指令就能安裝,用
hermes model即可切換連接的模型。Fireworks AI是內建的供應商,設定API金鑰後就能以token計價使用Kimi K3、DeepSeek V4、GLM 5.3等模型。Fireworks預設標榜零資料保留,但無伺服器推論的處理地點分散在全球,沒有限定日本的選項。安全使用的關鍵,是維持核准模式的預設值,並用Docker沙箱與egress代理,做到「代理碰不到真正的金鑰,也碰不到主機」。
Hermes Agent是什麼。三分鐘掌握
Hermes Agent是美國AI研究組織Nous Research在2026年公開的開源AI代理。README稱它為「自我改進型」:每完成一項任務,就能把步驟存成「技能(skill)」,下次直接重用。它會搜尋自己過去的對話、記住使用者的偏好,並自主執行終端機指令、檔案操作、網頁搜尋與瀏覽器操作2。
特點濃縮成三點。第一,不綁模型。README寫著「想用什麼模型都可以:Nous Portal、OpenRouter、OpenAI、自己的端點,還有很多」,用hermes model一個指令就能切換2。第二,不綁地點。除了終端機,還能從Telegram、Discord、Slack、WhatsApp、Signal對同一個代理說話;可以跑在自己的電腦、每月5美元的VPS,或Docker、SSH、Modal、Daytona、Vercel Sandbox這類隔離環境2。第三,開發速度。2026年8月31日的v0.21.0,彙整了自前一個主要版本以來約5,800次提交、約2,475件PR;9月11日的v0.21.2更是在短短四天內就有947次提交、140位貢獻者參與3。
這個速度有好的一面,也有要留意的一面。好的一面是資安修補與新模型支援幾天內就會進來。要留意的是,設定項目與指令可能隨版本改變。本文所有內容都以2026年9月12日的官方文件為準;半年後才讀到這篇的人,請先確認最新文件。
開發者Nous Research成立於2023年。根據TechCrunch報導,2026年7月時正以15億美元的估值洽談新一輪募資4。營收來源是名為「Nous Portal」的訂閱服務:免費方案只有免費模型,付費方案分為每月20美元(含22美元額度)、100美元、200美元三級5。這一點要先記住:代理本體免費,但背後的模型費用總得有人付。付給Nous Portal、付給Fireworks這類推論服務,還是自己買GPU,就是本文後半要談的選擇。
在日本的擴散也很快。NVIDIA在2026年5月的官方部落格寫道,Hermes Agent公開不到三個月就突破14萬顆星,依OpenRouter的統計成為「全球使用量最高的代理」6。然後就是開頭提到的理光日本。該公司在超小型的桌邊AI伺服器上預先安裝自家LLM與Dify,現在再加上Hermes Agent;分工是Dify負責例行業務、Hermes Agent負責需要個別判斷的非例行業務,賣點是機密資料不外傳、也沒有按token計費1。地端產品直接搭載開源代理這個決定本身,就說明了這個領域已經成熟到什麼程度。
「開放權重」和「在哪裡跑」是兩回事
進入設定之前,先釐清一個詞。「開放權重模型」指的是訓練完成的參數(權重)公開,任何人都能下載、在自己的環境執行的模型。DeepSeek、Qwen、Kimi、GLM,以及OpenAI的gpt-oss、Google的Gemma、NVIDIA的Nemotron都屬於這一類。
這裡常見兩個誤解。第一個是「開放權重等於開源」。權重公開,授權條款卻因模型而異。2026年9月12日Hugging Face上顯示的授權如下7。
| 模型 | 發布者 | 授權 | 企業使用時要看的條件 |
|---|---|---|---|
| DeepSeek V4 Flash(0731) | DeepSeek | MIT | 實質上沒有限制 |
| Qwen3.8 27B | Alibaba | Apache 2.0 | 實質上沒有限制 |
| gpt-oss-120b | OpenAI | Apache 2.0 | 實質上沒有限制 |
| Gemma 4 31B | Apache 2.0 | 實質上沒有限制 | |
| GLM 5.3 Flash | Z.AI | MIT | 實質上沒有限制 |
| GLM 5.3 | Z.AI | 自訂(以MIT為基礎) | 把模型當API對外提供的事業,年營收超過100億美元須通過Z.AI審查 |
| Kimi K3 | Moonshot AI | 自訂(以MIT為基礎) | 同類事業年營收超過2,000萬美元須與Moonshot另訂契約 |
| Nemotron 3.5 Lightning | NVIDIA | OpenMDW 1.1 | NVIDIA的開放模型授權 |
| MiniMax M3 | MiniMax | 自訂(community) | 需閱讀原文 |
Kimi K3與GLM 5.3的條件,針對的是把模型本身當成API轉售給第三方的「Model as a Service」事業。自家業務裡跑代理,幾乎不會碰到。但不要用「應該不會碰到」就帶過,建議還是讀一次原文,大約只有兩頁。
第二個誤解是「用開放權重,資料就不會外流」。權重公開,跟在哪裡跑是兩回事,而地點有三種。送到推論服務(Fireworks、Together、Nebius Token Factory,日本境內則有櫻花網路的AI Engine)執行;在自己的電腦上用Ollama或LM Studio執行;或在自家GPU伺服器上用vLLM等執行。選哪一種,資料的去向完全不同。Hermes Agent三種都支援,供應商清單裡同時列出Fireworks、Nebius Token Factory、Hugging Face、NVIDIA NIM這類推論服務,以及Ollama、LM Studio、vLLM、llama.cpp這類本機執行方式8。本文先談推論服務,並以Fireworks為例。
Fireworks AI是誰,資料會送到哪裡
Fireworks AI是專注於開放模型推論與訓練的美國公司。2026年7月15日宣布完成15.05億美元的D輪募資,估值175億美元。同一篇公告指出,年化營收已超過10億美元,每天處理超過40兆個token,其中95%以上來自以客戶自有資料特化的模型9。該公司對自己的定義不是「出租通用模型」,而是「協助客戶擁有自己的模型」。
價格公布在官方價格頁,以每百萬token的輸入、快取輸入、輸出順序標示。以下摘錄2026年9月12日的主要模型10。
| 模型 | 輸入 | 快取輸入 | 輸出 |
|---|---|---|---|
| Kimi K3 | $3.00 | $0.30 | $15.00 |
| Kimi K2.6 | $0.95 | $0.16 | $4.00 |
| DeepSeek V4.1 Flash | $0.22 | $0.007 | $0.66 |
| DeepSeek V4 Pro(0813) | $1.32 | $0.044 | $3.96 |
| GLM 5.3 | $1.40 | $0.26 | $4.40 |
| GLM 5.3 Flash | $0.15 | $0.03 | $0.50 |
| Qwen 3.8 Max | $2.00 | $0.25 | $6.00 |
| gpt-oss-120b | $0.15 | $0.015 | $0.60 |
| Nemotron 3.5 Lightning 30B | $0.05 | $0.01 | $0.20 |
和上一篇確認過的Claude Opus 5(輸入5美元、輸出25美元)相比,DeepSeek V4.1 Flash的輸入約為二十三分之一,輸出約為三十八分之一。能力當然不一樣。但代理在背後反覆做的「讀檔案」「整理測試結果」這類工作,多半不需要最頂級的模型。可以非同步處理的工作改走Batch API是半價,新帳號還附1美元的免費額度10。
接著是安全面。Fireworks的官方文件把「零資料保留(Zero Data Retention)」列為預設:對開放模型而言,除非使用者明確選擇加入,提示詞與生成結果都不寫入日誌、不寫入永久儲存;資料只在請求期間存在於揮發性記憶體,啟用提示詞快取時會在記憶體多留幾分鐘11。有一個例外:使用OpenAI相容的Response API時,store=True是預設值,對話會保留30天;加上store=False就不會保留,也可以用刪除API立刻清除11。Hermes Agent通常以Chat Completions格式連線,不受影響,但從其他工具使用時要記得這一點。
認證方面,Fireworks在自家網站表明已取得ISO 27001、ISO 27701、ISO 42001,並具備SOC 2 Type II與HIPAA支援12。這裡我只寫到「Fireworks如此表明」為止。我們沒有稽核過對方,簽約前請到該公司的Trust Center確認證書與稽核報告。
然後是本文最想傳達的一點。零資料保留,和資料在哪裡處理,是兩件事。 Fireworks的區域清單裡有美國各州、法蘭克福、冰島、馬來西亞、雪梨,以及東京(AP_TOKYO_1是H100,AP_TOKYO_2是H200)13。但這是租用專屬GPU的「部署(deployment)」才有的選項,而且單一區域需要申請並取得配額。大家實際在用的無伺服器推論,預設分散在全球各據點處理。想限定處理地點的人有「US-only Serverless」,透過us.api.fireworks.ai這個端點,可以把Kimi K3、DeepSeek V4 Flash、GLM 5.3等模型限制在美國境內執行,但2026年9月1日起是基本價格的1.5倍14。限定歐盟要洽詢業務,限定日本的無伺服器服務則不存在。想在東京執行,只能用專屬部署,而限定區域的部署費用是標準的1.5倍10。
也就是說,「用Fireworks就能在日本境內完成」是錯的;正確的說法是「Fireworks表明不拿資料訓練、也不保存,但處理地點遍布全球」。區域指定已經從一個設定項目,變成了收費項目。在理解這個事實之後,再決定哪些資料送去Fireworks、哪些不送。這條界線留到最後一節談。
步驟:從安裝到連上Fireworks
接下來是實際步驟,依官方Quickstart進行15。沒做過的人大約需要30分鐘。
1. 安裝。 macOS與Windows建議使用官方網站的Hermes Desktop安裝程式。只要命令列的話,macOS、Linux、WSL2在終端機執行下面這一行。
curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash
原生Windows則在PowerShell執行iex (irm https://hermes-agent.nousresearch.com/install.ps1)。安裝程式會一併裝好uv、Python 3.11、Node.js、ripgrep等。完成後用source ~/.zshrc(或.bashrc)重新載入shell2。
補充一點,在公司電腦上,「從URL下載腳本直接執行」這個動作本身可能就違反內部規範。這種情況下,請先下載腳本、確認內容再執行,或洽詢資訊部門。這不只適用於Hermes,而是所有這類工具都一樣。
2. 設定Fireworks的API金鑰。 在Fireworks的主控台產生API金鑰,登錄到Hermes。設計上,機密資訊存在~/.hermes/.env,一般設定存在~/.hermes/config.yaml,用下面的指令會自動寫到正確的那一邊15。
hermes config set FIREWORKS_API_KEY fw_xxxxxxxx
3. 選擇模型。 執行hermes model會開啟互動式選單,選「Fireworks AI」,再從即時目錄中挑模型。Fireworks的模型名稱是accounts/fireworks/models/kimi-k2p6這種以斜線分隔的格式8。直接用指令指定則如下。
hermes chat --provider fireworks --model accounts/fireworks/models/kimi-k2p6
有一點要注意。Hermes Agent要求模型至少有64,000個token的上下文長度,不符合的模型會在啟動時被拒絕15。Fireworks目錄裡的主要模型都沒問題,但後面談到的本機模型需要另外設定。
4. 第一次對話。 用hermes(或新介面hermes --tui)啟動,下一個容易驗證的指令,例如「把這個資料夾的內容用五行摘要」。畫面上方顯示模型名稱、沒有錯誤地回覆、而且能使用讀檔這類工具,就算成功。也順便確認hermes --continue能接續上一次的對話15。
5. 切換模型、準備備援。 對話中輸入/model,就能在已設定的供應商之間切換模型。這個組合的優點就在這裡:日常往來用便宜的DeepSeek V4.1 Flash,困難的設計問題用Kimi K3。再在config.yaml寫上fallback_providers,主模型碰到流量限制或故障時,會在保留對話的狀態下切到備援供應商8。
如果想用Together AI或日本的櫻花AI Engine而不是Fireworks,就登錄成「自訂端點」。只要伺服器提供OpenAI相容的/v1/chat/completions都能連,官方文件也附了Together AI的設定範例8。
# ~/.hermes/config.yaml
providers:
together:
api: https://api.together.xyz/v1
key_env: TOGETHER_API_KEY
model:
default: MiniMaxAI/MiniMax-M2.7
provider: custom:together
櫻花AI Engine同樣在日本境內提供OpenAI相容的API,用一樣的寫法就能連線。gpt-oss-120b的單價是每百萬token輸入15日圓、輸出75日圓,上一篇也提過它是完全在日本境內完成的選項16。
安全使用的設定。這才是正題
代理和聊天不同,它會「執行」。改寫檔案、跑指令、上網。所以設定一旦出錯,損害不是聊天答錯能比的。OWASP在2025年12月發布「Top 10 for Agentic Applications 2026」,把代理特有的風險整理成十項:目標劫持(ASI01)、工具濫用(ASI02)、權限濫用(ASI03)、供應鏈(ASI04)、非預期的程式碼執行(ASI05)、記憶污染(ASI06)等17。聽起來很抽象,但對到Hermes Agent的設定上,該做的事會變得相當具體。
先介紹一件這個領域實際發生的事。Palo Alto Networks的Unit 42在2026年7月30日報告,一名使用中文的攻擊者把Hermes Agent與DeepSeek組合起來,從Telegram下指令,讓代理自主對超過460個目標嘗試攻擊18。Hermes Agent和DeepSeek都是正當的開源軟體,就像菜刀不只用來做菜一樣,這是工具被濫用的案例。我注意的不是這一點,而是事情曝光的經過。攻擊者的代理在自己的家目錄啟動了檔案伺服器,把設定檔、API金鑰、目標清單、對話記錄整個暴露在網際網路上,Unit 42就是這樣發現的18。代理會照你說的做,一字不差,有時還做得比你說的更多。對防守方的教訓只有一句:一開始就把代理碰得到的範圍、拿得到的金鑰縮到最小。
Hermes Agent的安全文件就是依這個思路,準備了八層防護19。以下依序說明初學者最先該設定的項目。
核准模式維持預設的smart,不要用--yolo。 Hermes在執行危險指令前會要求人類核准。預設的smart模式由輔助模型評估風險:python -c "print('hello')"這類低風險指令自動放行,真正危險的自動拒絕,只有拿不定主意的才問人。--yolo旗標、/yolo指令、HERMES_YOLO_MODE=1會跳過全部核准,畫面會一直顯示紅色警告。除了在用完即丟的環境跑自動化腳本,不要使用。另外,rm -rf /、fork bomb、直接寫入磁碟、把URL下載的內容直接灌進shell這幾類操作,列在「硬性封鎖清單」上,就算YOLO或關閉核准模式也不會執行19。cron無人值守的工作碰到危險指令時,預設是拒絕(cron_mode: deny),這裡也不要改。
用Docker隔離終端機。 這是最有效的一項設定。執行hermes config set terminal.backend docker,代理執行的指令就會跑在容器裡,而不是主機上。官方容器啟動時會丟掉所有Linux權限(--cap-drop ALL)、禁止提權、把程序數限制在256、把可寫入的位置限定在/opt/data19。安全文件的比較表裡,local寫的是「無隔離,在主機上執行」,docker寫的是「容器就是邊界」。我的建議是:先用local試試看、抓到感覺,在讓代理接觸公司資料之前,切換到docker。
不把真正的金鑰放進沙箱。 就算用Docker隔離,容器裡若有真正的API金鑰,用提示注入讓代理打一句printenv | grep -i key就能偷走。Hermes用「egress代理」堵住這個洞:沙箱裡只放不透明的替代token,主機端的代理程式會攔下對外連線,換回真正的金鑰20。用hermes egress setup與hermes egress start啟用。2026年9月時只支援Docker後端。另外,terminal.docker_forward_env這個設定預設是空的,寫進去的變數會變成容器內可讀。不要因為「方便」就把API金鑰放進去19。
先決定哪裡不能寫。 在write_file或patch碰到磁碟之前,Hermes會把目標路徑和拒絕清單比對。~/.ssh/、~/.aws/、~/.kube/、/etc/sudoers、~/.netrc,以及專案內的.env系列檔案一律拒絕,連核准提示都不會出現。再設定HERMES_WRITE_SAFE_ROOT,指定目錄以外就完全寫不了19。文件裡還有一句很誠實的提醒:代理說「已經修改」時,實際上可能被拒絕了,請相信畫面下方的驗證列而不是代理的總結。
縮小它能連出去的範圍。 網頁搜尋與瀏覽器操作,預設拒絕存取內部網路與雲端中繼資料(169.254.169.254)等私有位址,DNS查不到時也往拒絕的方向倒。把security.allow_private_urls設為true可以解除,但文件警告公開的閘道千萬不要開。也能用website_blocklist個別禁止公司內部的管理介面19。
從Telegram等平台使用時,允許清單是必要的。 訊息平台閘道很方便,但「誰都能傳訊息給它」等於「誰都能在你的電腦上執行指令」。正式環境不要設GATEWAY_ALLOW_ALL_USERS=true、用配對碼登錄使用者、以非root執行、把~/.hermes/.env設成chmod 600。官方的部署檢查清單就是依這個順序排列的19。
也要留意供應鏈。 技能、外掛、MCP伺服器,都是把別人寫的程式碼與指示載入代理。Hermes在hermes skills install時會執行資安掃描,外掛有第一階段掃描,變更紀錄裡也留有在上游遭入侵後移除「Blender MCP」目錄項目與技能的紀錄3。此外,AGENTS.md這類指示檔若有提示注入的痕跡就不載入,環境裡若存在已知受污染的套件版本(文件以2026年5月的mistralai套件污染為例)會在啟動時警告19。對使用者來說,可以歸納成兩個習慣:定期執行hermes update,以及不要忽視hermes doctor的警告。
還有一個不起眼但重要的功能。從v0.21.0起,若選到的模型屬於會拿使用者資料訓練的類型,所有選擇畫面都會跳出警告3。這種模型確實存在,例如Meta的「contributor」層級,就是以較低價格換取用你的提示詞訓練的權利8。警告出現時,機密用途就不要選它。光是這一點就能避免一整類事故。
哪些資料,交到什麼程度
設定講完了,最後談判斷。讀到這裡,你心裡大概還有一個問題:「所以公司資料到底能不能送去Fireworks?」我的答案是:依資料類型分開處理。
第一類是公開資訊,以及外洩也無妨的資料。摘要已公開的技術文件、閱讀開源程式碼、一般性的調查。這些用Fireworks的全球無伺服器就好。有零資料保留的聲明,單價又是頂級模型的幾十分之一,沒有理由在這裡用貴的模型。
第二類是公司內部的一般業務資料。會議記錄、內部流程、不含客戶名稱的資料。這要看公司政策,但至少負責的人應該在知道「處理地點分散在全球」的前提下做決定。想限定在美國境內,可以用加價五成的US-only Serverless14。如果和客戶的契約有「資料處理地點」條款,那一條就是判斷依據。
第三類是機密資料。圖面、未公開的財務資訊、客戶的個人資料、合作夥伴託付的資訊。我的立場是,這些不該送到全球無伺服器。理由與其說是法律,不如說是客戶稽核、契約,以及外國政府對境外伺服器資料的取得權限這類制度上的不對稱。選項有三個:在Fireworks的東京區域建立專屬部署(費用1.5倍,還要申請配額);使用櫻花AI Engine這類完全在日本境內完成的推論服務;或用理光日本的套件、NVIDIA DGX Spark這類設備在自己手邊執行。依NVIDIA的部落格,Qwen 3.6的35B模型約20GB記憶體就能跑,DGX Spark有128GB統一記憶體,能整天跑1,200億參數的模型6。Hermes Agent原生支援Ollama與LM Studio,設定上的門檻並不高8。
在本機執行的弱點,上一篇也寫過:網頁搜尋與工具整合的品質、回應速度,以及維運人員的時間。老實說,如果連非機密的工作都塞到本機模型,代理會因為太慢而沒人用。所以才要「分開」。同一個Hermes Agent,一個/model指令就能在便宜的外部模型和日本境內的模型之間切換。這是我目前認為最務實的組合。
我們在ZEROCK做的,也是把這種「分開」變成組織層級的運作機制。在代理與模型之間放一個閘道器,依資料類別在同一個地方決定送往日本境內或境外、用哪個模型。使用者只要改寫base_url,就能從Hermes Agent這類開源代理直接使用。不依賴個別使用者的自律,而是把公司政策實作成設定。我認為這是企業使用開放權重模型的前提條件。詳情請見ZEROCK頁面。
結語
Hermes Agent免費、不綁模型、到處都能跑。但一加上「安全」這個條件,該做的事就很清楚。核准模式維持預設;用Docker隔離終端機;用egress代理藏住真正的金鑰;閘道加上允許清單;不要怠惰更新。並且理解Fireworks的零資料保留是「不拿來訓練、不保存」的聲明,而不是「在日本境內處理」,再依資料類型決定去向。
如果今天就要動手,請先在自己的電腦上、只用公開資料、維持local後端,花一小時摸一摸。身體記住代理會做什麼之後,再切換到docker,然後才讓它接觸公司資料。守住這個順序,大部分的事故都能避免。想一起設計開放權重模型與公司內部資料之間的界線,歡迎透過個別諮詢聊聊。
Footnotes
-
「RICOH地端LLM入門套件」邊緣機型搭載自我改進型AI代理「Hermes Agent」(理光日本株式會社,2026年9月10日,日文) ↩ ↩2
-
NousResearch/hermes-agent README(GitHub,2026年9月12日取得:244,608顆星、50,705個fork、MIT) ↩ ↩2 ↩3 ↩4 ↩5
-
Hermes Agent Releases:v0.21.0(2026年8月31日)、v0.21.2(2026年9月11日)(GitHub) ↩ ↩2 ↩3
-
Hermes agent maker Nous Research in talks for new funding at $1.5B valuation(TechCrunch,2026年7月13日) ↩
-
Hermes在NVIDIA RTX PC與DGX Spark上實現自我改進型AI代理(NVIDIA Japan Blog,2026年5月22日,日文) ↩ ↩2
-
Hugging Face各模型卡與LICENSE檔(2026年9月12日取得):deepseek-ai/DeepSeek-V4-Flash-0731、Qwen/Qwen3.8-27B、openai/gpt-oss-120b、google/gemma-4-31B-it、zai-org/GLM-5.3 LICENSE、moonshotai/Kimi-K3 LICENSE、nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16 ↩
-
LLM and Model Providers — Hermes Agent Docs(Nous Research) ↩ ↩2 ↩3 ↩4 ↩5 ↩6
-
Announcing our Series D and $1B ARR(Fireworks AI,2026年7月15日) ↩
-
Serverless Pricing(Fireworks AI Docs,2026年9月12日取得) 與 Pricing(Fireworks AI) ↩ ↩2 ↩3
-
Zero Data Retention — Data retention policies at Fireworks(Fireworks AI Docs) ↩ ↩2
-
US-only Serverless(Fireworks AI Docs) 與 Data residency(Fireworks AI Docs) ↩ ↩2
-
Hermes Agent Quickstart — Hermes Agent Docs(Nous Research) ↩ ↩2 ↩3 ↩4
-
OWASP Top 10 for Agentic Applications 2026(OWASP Gen AI Security Project,2025年12月) ↩
-
Chinese-Speaking Threat Actor Harnesses AI Models for Autonomous Cyberattacks(Palo Alto Networks Unit 42,2026年7月30日) ↩ ↩2
-
Security — Hermes Agent User Guide(Nous Research) ↩ ↩2 ↩3 ↩4 ↩5 ↩6 ↩7 ↩8
-
Egress credential-injection proxy (iron-proxy) — Hermes Agent Docs(Nous Research) ↩






