MimiClaw:用 5 美元 ESP32 跑一台 OpenClaw AI 助理

MimiClaw 是開源專案,用純 C 把 OpenClaw agent 框架塞進 5 美元的 ESP32-S3 晶片,插電連 Wi-Fi 就能透過 Telegram 對話。但 agent 邏輯雖在晶片上跑,語言模型推論仍走 Anthropic 或 OpenAI 雲端 API。

用 AI 摘要這篇文章:

在 AI 隨身硬體動輒上百美元的年代,一台 5 美元的 ESP32 晶片能做什麼?開源專案 MimiClaw 給了一個具體的方向:它把 OpenClaw 這套 AI agent 框架,用純 C 語言塞進一片拇指大小的 ESP32-S3 晶片裡,插上 USB 電源、連好 Wi-Fi,就能透過 Telegram 跟它對話,讓它幫你處理任務、還會把記憶存在晶片上、斷電不消失。這不是把晶片當成把語音轉發到雲端的傳聲筒,而是讓 agent 邏輯真正在晶片上跑起來。

這類「邊緣 AI agent」是近期開源圈一個值得觀察的方向:把 agent 的決策、記憶與工具呼叫做成低成本硬體型態,隨插隨用。MimiClaw 是其中一個代表,掛在 OpenClaw 生態下,MIT 授權、純 C 實作。下面拆解它實際在做什麼、要怎麼上手、以及幾個動手前該先知道的事。

MimiClaw GitHub 倉庫頁面,顯示 MIT 授權與 ESP32 純 C 專案說明Pin
MimiClaw 的 GitHub 倉庫,標明 5 美元晶片上跑 OpenClaw、純 C 實作。

它實際在做什麼

MimiClaw 的核心,是把一個 agent 迴圈搬上 ESP32-S3 晶片。流程是這樣的:你在 Telegram 傳訊息給它,ESP32 透過 Wi-Fi 收到訊息,丟進晶片上的 agent 迴圈,這個迴圈會讓大型語言模型思考、視需要呼叫工具(例如查時間、查網頁)、讀取本地記憶,再把回覆送回 Telegram。整個 agent 的調度邏輯跑在晶片上,而不是把所有事都轉發到外部伺服器處理。

MimiClaw 運作流程圖,Telegram 訊息經 ESP32 agent 迴圈呼叫 LLM 與工具後回覆Pin
MimiClaw 的運作流程:Telegram 訊息進入晶片上的 agent 迴圈,思考、呼叫工具、讀記憶後回覆。

它支援兩種大型語言模型供應商:Anthropic 的 Claude 與 OpenAI 的 GPT,兩者可以在執行時切換,帶哪一家的 API Key 就用哪家。記憶則以純文字形式存在晶片的 Flash 裡,所以即便拔掉電源再插回,它還記得你的名字與過去的對話。和市售那種只能照表操課的智慧音箱相比,它能視情境自己判斷該不該主動呼叫工具,agent 的調度與記憶都留在本地晶片;功耗也只有 0.5 瓦,插在路由器的 USB 供電上就能二十四小時待命。

動手前要準備什麼

把 MimiClaw 跑起來需要三類東西。硬體方面,要一塊帶 16MB Flash 與 8MB PSRAM 的 ESP32-S3 開發板,README 推薦的 Xiaozhi AI 板大約 10 美元上下;5 美元指的是 ESP32-S3 晶片本身的身價,實際買到能用的開發板會高一點。環境方面,需要先裝好 ESP-IDF v5.5 以上的開發框架,整個專案是純 C 語言寫的,沒有 Linux、沒有 Node.js,這也是它能塞進資源有限的微控制器的前提。

服務方面,你需要一組 Telegram Bot Token(向 BotFather 申請),以及一組 Anthropic 或 OpenAI 的 API Key。也就是說,晶片本身雖然便宜,但它背後的「大腦」是雲端的大型語言模型,要靠你自己的 API 額度運作,這一點會在後面「隱私與成本」再細談。

燒錄與設定的流程

實際把它跑起來,大致是幾個步驟。先照 ESP-IDF 的官方文件把開發環境裝好,這是純 C 嵌入式開發的標準前置作業;接著把 MimiClaw 的原始碼抓下來,設定好 Wi-Fi 帳密、Telegram Bot Token 與 API Key 這些環境變數,然後用 ESP-IDF 的工具鏈把韌體編譯、燒錄到 ESP32-S3 上。剛開始跑通常會在網路連線與記憶體配置上花點時間排查,屬於嵌入式開發常見的摸索期。

燒錄完成、接上電源後,ESP32 會連上你設定的 Wi-Fi,開始監聽 Telegram 訊息;這時你在 Telegram 上跟它說話,就會觸發前述的 agent 迴圈。值得一提的是,整個設定過程都需要看文件、動手改設定檔,目前沒有一鍵安裝的圖形介面,這也是它被定位為「給願意折騰硬體的開發者」而非一般消費者的原因。

「完全私有」這句話要拆開看

MimiClaw 標榜「去中心化、低功耗、完全私有」,這句話要拆兩層才準確。私有的那一層是真的:agent 的調度邏輯、你的記憶與對話歷史,都存在你自己那片晶片的 Flash 上,不經過第三方伺服器存放。但另一層要說清楚:你傳給它的訊息,最終還是會送到 Anthropic 或 OpenAI 的雲端 API 做推論,模型本身不在晶片上。換句話說,私有的是 agent 執行環境與本地資料,不是語言模型的推論過程。

這種「本地 agent 加雲端模型」的架構,其實是當前邊緣 AI 工具共同的樣貌,並不是 MimiClaw 獨有的取捨。如果你處理的是特別敏感的內容,要明白對話內容會經過你選的那家 API 供應商;真正的「完全離線推論」需要把模型也搬上裝置,那會是另一個完全不同等級的硬體需求,通常得靠算力更強的邊緣運算板才辦得到。也因此,把 MimiClaw 想成「私人 agent 執行環境+你自己選的雲端大腦」會比把它想成「完全不上雲的 AI」更貼近它真實的樣貌,挑選 API 供應商時,等於也決定了你的對話內容交給誰處理。

跟 PicoClaw 放在一起看

把 MimiClaw 放到同類邊緣 AI agent 裡看,會更清楚它的位置。同樣把 AI agent 做成低成本硬體的,還有 PicoClaw 邊緣 AI agent,它走的是 Go 語言單一二進位、跑在 Sipeed 等邊緣運算硬體上,定位偏多架構的邊緣運算;MimiClaw 則更極端,直接用純 C 把 agent 收進一片幾美元的 ESP32,體積與功耗都壓到更低。兩者可以視為「邊緣 AI agent」這個新品類底下,不同硬體等級與語言選擇的兩個範本,也各自適合不同類型的開發者。

項目MimiClawPicoClaw
硬體ESP32-S3(微控制器)Sipeed 等邊緣運算板
語言純 C(ESP-IDF)Go 單一二進位
成本晶片約 5 美元、板子約 10 美元約 10 美元起
功耗約 0.5 瓦較高(視板子而定)
定位極小體積、長期待命的硬體 agent多架構邊緣運算 agent
MimiClaw 與 PicoClaw 兩個邊緣 AI agent 的定位對照。

它們也都掛在 OpenClaw 生態下。TechMoon 先前介紹過這個生態的幾個面向:ClawX 把 OpenClaw 包成桌面圖形介面第三方一鍵部署腳本負責快速架站,而 MimiClaw 負責的是「把 OpenClaw 塞進最小最便宜的硬體」這一環。同一套 agent 框架,從伺服器、桌面到微控制器,各有人在做對應的載體。

實際能用來做什麼

把它放進生活裡,最直接的用法是當一個二十四小時待命的私人助手:插在路由器的 USB 供電上,你在任何裝置打開 Telegram 就能跟它對話,問問題、請它幫忙整理資訊、或設定要它記住的偏好,它會把這些內容寫進晶片裡的本地記憶,下次對話時還記得。因為它具備工具呼叫能力,也能在對話過程中主動去查時間、查網頁資訊,而不是只能憑訓練資料回答。

對開發者來說,更大的價值在於它是一套可拆開來研究的硬體 agent 樣板。你可以拿它理解「agent 迴圈+本地記憶+工具呼叫」這套架構,怎麼在資源極度有限的微控制器上實現;熟悉之後,換掉 API 供應商、加上新的工具、或接上其他感測器與周邊,都能在這個基礎上繼續擴充。換句話說,它不只是成品,更像一個讓你練手、再長出自己版本的起點。

限制與該留意的事

動手前有幾個現實限制要先知道。PSRAM 不可省:大型語言模型回傳的 JSON 體積很大,少了 PSRAM 擴充,晶片會記憶體不足而反覆重啟,所以一定要挑 N16R8 這類帶 PSRAM 的版本,別只看晶片便宜就買錯規格。API 成本也要留意,硬體雖然只要幾美元,但模型推論按 token 計費,加上它具備工具呼叫能力,一次對話可能觸發多次模型來回,實際花費會比單純問答高一點;建議在程式裡設好 max_tokens 上限,剛開始先觀察幾天用量,再決定要不要放寬或換用計費較低的模型。

網路與專案活躍度也值得放進考量。ESP32 需要能連到 Claude、Telegram 這些 API 服務,在部分地區得透過代理才能穩定使用;台灣本地連這些服務大致直接,但仍建議先確認網路環境與 API 可用性,尤其是 Telegram 在少數網路環境下會被限制,會直接影響這套以 Telegram 為介面的助手能不能用。另外,這個專案雖然累積了五千多顆星,但最近一次更新停在 2026 年 4 月、版本也還在 v0.1.x,屬於早期階段,後續維護節奏值得觀察,把它當成可學習的硬體 agent 範本、而非成熟的量產方案會更踏實;若決定長期使用,建議定期留意倉庫的更新與 issue 動態,並把自己的修改保留一份,避免上游停更後接手困難。

適合誰動手

MimiClaw 適合喜歡折騰硬體、追求本地 AI、而且願意看文件自己動手的開發者。如果你本來就對嵌入式開發、ESP-IDF、或 OpenClaw 生態有感,把它當成一個可拆解、可擴充的硬體 agent 樣板來玩會很有收穫。相對地,如果你期待的是插上電就能用、不想碰韌體燒錄與設定的現成產品,那 MimiClaw 目前離那個狀態還有距離,像 Rabbit R1 這類消費級 AI 隨身裝置會更對你的胃口。不過也正因為它門檻低、可拆解,對想親眼看到 AI agent 怎麼在資源極有限的硬體上落地的人來說,它提供的是一個很難從現成產品上得到的學習視角,這份動手理解的過程,本身就是它最大的價值之一。

常見問題

MimiClaw 是完全離線運作的嗎? 不是。agent 邏輯與記憶在晶片上跑,但語言模型推論是透過 Anthropic 或 OpenAI 的雲端 API,需要網路與 API Key。真正的離線推論需要把模型也搬上裝置,硬體需求完全不同。

硬體真的只要 5 美元嗎? 5 美元是 ESP32-S3 晶片本身的價格,實際能用的開發板(帶 16MB Flash 與 8MB PSRAM)大約 10 美元上下,仍屬非常便宜的硬體 AI 方案,門檻比多數人想像的低。

它只能接 Claude 嗎? 不是,支援 Anthropic Claude 與 OpenAI GPT 兩種供應商,可在執行時切換,帶哪一家 API Key 就用哪一家。

為什麼一定要 PSRAM 版本? 大型語言模型回傳的 JSON 資料量大,沒有 PSRAM 晶片會記憶體溢出並反覆重啟,所以必須挑 N16R8 這類帶 PSRAM 的開發板。

這個專案還在持續更新嗎? 它累積了五千多顆星、MIT 開源,但最近一次更新停在 2026 年 4 月,版本仍在 v0.1.x 早期階段,後續維護節奏需要觀察,建議當作學習用範本而非成熟方案,想長期依賴的話,記得定期回倉庫看看維護狀況。

想動手玩的話

如果你對邊緣 AI agent 有興趣,又願意花一個週末折騰韌體與設定,MimiClaw 是成本極低、且能讓你把整套 agent 架構摸過一遍的入場券。先到它的 GitHub 倉庫 把 README 與硬體需求看清楚,備好帶 PSRAM 的 ESP32-S3 開發板、Telegram Bot Token 與一家模型的 API Key,就能照文件燒錄試跑。把它當成一個會成長的硬體助手、同時也是一套可拆解學習的範本,會比期待它開箱即用更接近它現在真正的模樣。一旦跑通了第一次,你會發現手上這片幾美元的小板子,能裝下的想法遠比它迷你的體積所暗示的還要多。對願意花時間拆解的人來說,這會是一個比帳面規格有趣得多的實驗起點,也讓你對「AI agent 究竟能在多小的裝置上落地」有第一手的體會。

Sliven 褚崇名
Sliven 褚崇名

每日分享科技新知、免費資源以及 WordPress、虛擬主機相關主題,任何問題歡迎在科技月球下方留言,或是發送 Email 至 [email protected] 與我聯繫。

文章: 687

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *


Share to...