摘要
摘要(更新日期:2026-08-07 發布日期:2026-08-07)
Skill Recorder 是微軟 2026 年 7 月 29 日開源(MIT)的桌面應用程式,主張「錄一次你做事的過程,就變成 AI 代理可以重複執行的技能」。它在本機錄下你的點擊、視窗切換、造訪的網址與選用的口述旁白,接著把資料送交 GitHub Copilot 重建成「一個意圖 + 一串有序步驟」,最後產出可重複使用的 Skill(一份 SKILL.md)或 Automation(同一份流程,改為排程或觸發執行)。
它最聰明的設計是拒絕當 UI 錄製器:產出的技能會優先使用代理的原生工具(例如 gh CLI 或 web_fetch),而不是重播滑鼠點擊,並且會從你的單一範例泛化——錄一次送出表單,教會代理送出所有表單。
但實際查證後有兩個落差。第一,README 從頭到尾沒有說明產生的技能要放到哪裡執行,Scout、Cowork、Copilot Studio 三個名字一次都沒出現。第二,翻開原始碼中的 electron/architectures/catalogues/,可以看到它只支援三個輸出目標,而沒有一個能操作原生桌面應用程式:通用目標明文禁止瀏覽器自動化,Cowork 明文寫著自己不能點擊網頁 UI,Scout 有瀏覽器自動化但僅限網頁。真正能操作桌面 UI 的 Copilot Studio computer use(2026-05-13 正式上線)並不在清單中。
因此結論是:它錄得到的範圍,遠大於它用得到的範圍。判斷它對你有沒有用只有一條標準——你要自動化的那件事,背後有沒有 CLI 或 API。有,它能幫你把滑鼠路徑翻譯成指令路徑;沒有,它幫不上忙,而那恰好是最想自動化的那一群系統。以下內容以 2026-08-07 查證的 v0.4.1 為準,若下文與此摘要衝突,以本摘要為準。
一、聽起來很有用
Skill Recorder 的第一句自我介紹寫得非常好:
Record yourself doing a task once, then turn it into a skill your AI agent can repeat.
錄自己做一次任務,然後把它變成你的 AI 代理可以重複執行的技能。
github.com/microsoft/skill-recorder README(查證 2026-08-07)這句話戳中的痛點很真實:寫技能檔案的困難從來不是格式,而是把腦子裡的默會流程翻譯成文字。你知道怎麼做,但要一步一步寫下來很累,而且常常漏掉自己習以為常的判斷。用「做一遍」取代「寫一遍」,直覺上確實省事。
四個階段
- 錄製:按下錄影鍵(
⌘⇧R或Ctrl+Shift+R),照常做你的任務,程式在背景於本機擷取畫面與活動。 - 控制:錄製期間有一條常駐最上層的小工具列,顯示擷取與麥克風狀態,可即時靜音、換麥克風、結束或捨棄這一次。
- 分析:按下 Analyze,GitHub Copilot 重建出一個整體意圖與一串有序步驟,你可以審閱與修改到讀起來正確為止。
- 建立:從審過的分析結果,產生可重複使用的 Skill 或排程用的 Automation。
真正聰明的那一句設計原則
它不是傳統的 RPA 錄製器。README 明講兩種產出都會:
Both prefer the agent's native tools (like the gh CLI or web_fetch) over replaying UI clicks, and generalize from your one example, so recording yourself submitting one form can teach the agent to submit all of them.
兩者都優先使用代理的原生工具(例如 gh CLI 或 web_fetch),而非重播 UI 點擊;並且會從你的單一範例泛化,所以錄下自己送出「一張」表單,可以教會代理送出「所有」表單。
這是整個專案最有見地的一句。它承認了一件業界花了二十年學會的事:模擬滑鼠點擊很脆——版面一改就壞、慢、貴、出錯難查。所以錄影在這裡不是要照著演一遍的腳本,只是拿來反推意圖的素材。你在瀏覽器上點了半天 GitHub,它產出的步驟可能直接是「執行 gh pr list」。
記住這句話。它同時也是後面那把剪刀的其中一片刀刃。
二、實際上要怎麼用?前半段很清楚
先講清楚的部分。安裝方式相當特別:它沒有提供編譯好的安裝檔。
官方稱之為「原始碼發行」(source release):你到 Releases 頁複製對應平台的指令,該指令會下載一個固定版本的 Node.js 執行環境,在你自己的機器上編譯該版本的原始碼,然後建立一個「Skill Recorder (Source)」應用程式。macOS 會裝進 ~/Applications,Windows 會建立桌面與開始功能表捷徑,Ubuntu 會加一個應用程式項目。整個過程不做任何全域安裝。
附帶結論:這個專案的下載數是查不到的
因為是原始碼發行,截至 2026-08-07 的七個 release(v0.1.0 至 v0.4.1)全部沒有任何附加檔案。所以「下載次數」這個指標在這個專案上根本不存在,看到有人用它評斷採用率,那是誤讀。可用的公開數字只有 2,145 顆星、223 個 fork、30 個未結 issue。
每個 release 會把安裝腳本與要編譯的原始碼都釘在同一個 40 字元的 commit 上,這點做得嚴謹。不過實務上你仍是在把一段 curl 下來的腳本直接餵給 bash;官方也知道這件事,所以文件裡特別留了「想先檢視腳本再執行」的說明頁。
接著錄製也很清楚:首次啟動時 macOS 會要求螢幕錄製權限,授權後即可錄。第一次按 Analyze 時,若尚未登入會出現「Sign in to Copilot」。你需要一個具備 Copilot 存取權的 GitHub 帳號,Copilot CLI 本身隨應用程式附上。若要使用旁白功能,首次會下載約 252 MB 的 Whisper 模型,之後轉文字都在本機完成,支援 99 種語言。
然後文件就斷了
從「產生了一份 Skill」到「這份 Skill 在哪裡執行」之間,README 沒有任何說明。
這不是印象,是可以驗證的:這個專案的倉庫描述(repo description)寫著產出可供 Microsoft Scout、Microsoft Copilot Cowork 或 Copilot Studio 使用,但 README 全文零次提到這三個名字中的任何一個。倉庫裡的說明文件也只有安裝、發行流程、評測框架與 Windows 擷取細節,沒有一份講輸出去向。
所以「不知道怎麼用」不是你的問題
安裝、錄製、分析、產生技能——這四步都寫得很清楚。但一份技能要怎麼裝進代理、Scout 一般人拿不拿得到、Copilot Studio 怎麼接,官方文件一句都沒寫。這正是下一節要翻原始碼的原因。
三、翻開原始碼:三個目標,沒有一個能碰原生 App
答案藏在 electron/architectures/catalogues/ 這個目錄。裡面有三個檔案,每一個都是一份「目標能力清單」——一段直接內嵌進 Copilot 系統提示的文字,用來告訴它:你產出的技能可以依賴哪些能力。
換句話說,這三份檔案就是這個工具對世界的假設。全部只有三個目標:
| 輸出目標 | 是什麼 | 能操作網頁 UI? | 能操作原生 App? |
|---|---|---|---|
| agent-skill | 通用 SKILL.md,不綁定任何廠商 |
否——明文禁止 | 否 |
| Cowork | Microsoft 365 Copilot 代理 | 否——明文寫著沒有這種工具 | 否 |
| Scout | 跑在使用者自己裝置上的代理 | 可以——有 Playwright | 否 |
通用目標:明文禁止瀏覽器自動化
通用的 agent-skill 目標刻意不列出任何專屬工具,好讓產出的技能能載入到使用者選擇的任何代理。代價是它只准依賴「每個代理都合理具備」的能力:
Do NOT assume host-specific integrations — no Teams / Outlook / Calendar / WorkIQ, and no browser automation. Rely only on capabilities every agent can reasonably provide: reading and writing files, running shell commands and standard CLIs, and calling documented HTTP APIs. Map each recorded UI action to a portable tool, an API call, or a CLI — never write "click" / "type" UI steps.
不要假設有主機專屬的整合——沒有 Teams/Outlook/日曆/WorkIQ,也沒有瀏覽器自動化。只能依賴每個代理都合理提供得了的能力:讀寫檔案、執行 shell 指令與標準 CLI、呼叫有文件的 HTTP API。把每個錄到的 UI 動作對應到可攜工具、API 呼叫或 CLI——絕不要寫「點擊」/「輸入」這類 UI 步驟。
electron/architectures/catalogues/agent-skill-catalogue.ts(版本標記 2026-08-06)Cowork:一句寫進系統提示的自白
Cowork 目標的能力清單極長,Teams、Outlook、日曆、SharePoint/OneDrive、組織目錄、Power BI 一應俱全,也明確要求「GitHub 一律走 gh CLI,絕不要用瀏覽器操作 github.com」。但在工具清單最後,有這麼一段:
No browser automation. Cowork has NO Playwright / browser_* tools — it cannot click or type in a web UI. For a web app with no API and no CLI, the most it can do is READ a public page with core/web_fetch. So map every recorded UI step to an M365 tool, a CLI, or an API; if a step genuinely requires driving a UI Cowork can't automate, call it out in the skill rather than pretending to click.
沒有瀏覽器自動化。Cowork 沒有 Playwright/browser_* 工具——它無法在網頁 UI 中點擊或輸入。對於沒有 API 也沒有 CLI 的網頁應用程式,它最多只能用 core/web_fetch 讀取公開頁面。所以請把每個錄到的 UI 步驟對應到 M365 工具、CLI 或 API;如果某個步驟真的必須操作 Cowork 無法自動化的 UI,就在技能裡直說,不要假裝點得到。
最後那半句值得停下來看一次。微軟在自家產品的系統提示裡,預先寫好了失敗時的措辭。這是一份非常誠實的文件,同時也是一份非常清楚的能力聲明。
Scout:唯一能點 UI 的,但只限網頁
Scout 是三者中唯一有瀏覽器自動化的:它列出 browser_navigate、browser_snapshot、browser_click、browser_type、browser_fill_form 等 Playwright 工具,但定位講得很小心——「UI 後備方案,只給那些沒有 API 也沒有 CLI、非得從 UI 操作不可的網頁應用程式(GitHub 不算,請用 gh)」。
注意兩件事。第一,仍然是網頁,Playwright 碰不到 Windows 視窗程式。第二,Playwright 開的是乾淨的瀏覽器設定檔,沒有你的登入狀態——這對需要登入的內部系統是個現實問題。
而 Copilot Studio 根本不在原始碼裡
倉庫描述寫著支援 Copilot Studio,但 catalogues/ 目錄下沒有它的檔案。這一點特別關鍵,因為 Copilot Studio 的 computer use 正是微軟唯一能操作原生桌面應用程式的產品——2026 年 5 月 13 日正式上線,用視覺模型直接看畫面點按鈕、選選單、打字,底層模型可選 Anthropic Claude Sonnet 4.5 或 OpenAI 的 CUA。唯一補得上這個洞的東西,恰好沒接上。
於是核心矛盾成立了:它錄整個桌面,包含 Excel、終端機、各種原生應用程式;但它三個輸出目標沒有一個能重播原生 App 的操作。錄得到的,遠多於用得到的。
四、那什麼情況下真的有用?
判準其實只有一條,而且可以在錄影之前就先問自己:
唯一的判準
你要自動化的那件事,背後有沒有 CLI 或有文件的 API?有,它能幫上忙;沒有,它幫不上,而且不是設定問題,是結構問題。
會有用
- GitHub 相關流程——三份能力清單都反覆強調「GitHub 一律走
gh」,這條路徑打磨得最完整 - Microsoft 365 相關流程——Teams、Outlook、日曆、SharePoint、組織目錄的工具清單極長
- 你知道怎麼點,但不知道有對應指令的任務——這才是它的真正價值:把滑鼠路徑翻譯成指令路徑
- 需要把默會流程交給不熟的同事——產出的步驟文件本身有溝通價值,即使沒人執行它
不會有用
- 公司內部 ERP、進銷存、老後台——沒有公開 API,沒有 CLI,只有畫面
- Windows 原生視窗程式——三個目標都碰不到
- 需要登入狀態的網頁系統——Scout 的 Playwright 開的是乾淨設定檔
- 畫面上有營業資料的任何流程——分析階段會把螢幕影像送上雲端,見下方資料政策
錄之前先看清楚:資料會上雲,而且可能被用於訓練
錄製、儲存與旁白轉文字都在本機;但一旦按下 Analyze,事件時間軸(視窗與文件標題、網址、剪貼簿預覽)、擷取出的螢幕影像與旁白文字就會送到 GitHub 雲端交給 Copilot 處理。
README 的警語是「不要錄到密碼、權杖、API 金鑰」——但對企業使用者而言,真正的風險不是密碼,是螢幕上的營業資料:廠商名稱、單價、成本、客戶資料。
更要留意的是訓練政策:GitHub 自 2026 年 4 月 24 日起,將 Copilot Free、Pro、Pro+ 使用者的互動資料(輸入、輸出與相關脈絡)用於訓練與改進其 AI 模型,除非使用者主動選擇退出;Copilot Business 與 Enterprise 不在此範圍。GitHub 未針對 Skill Recorder 另發政策,因此應以一般 Copilot 條款理解。用個人方案錄公司畫面,這是一個需要先問過的問題。
五、把兩件事並排看,價值就被夾掉了
前面的觀察各自都只是缺點。但把兩片並排,會發現它們是一把剪刀:
gh 把 issue 關掉並留言」就好了。這個判斷跟「產品還不成熟」無關。就算微軟明天把文件補齊、把 Copilot Studio 接上,這把剪刀還是合的——除非他們讓 computer use 成為輸出目標,而那等於承認「優先用原生工具而非重播點擊」這個核心主張失敗。
它最漂亮的那句設計原則,正是殺死它自己的那句。
還有第三刀:繞了一圈回到原點
它唯一還算通用的產出,是一份 SKILL.md——帶 name、description、allowed-tools 欄位,格式與 Claude Code 的 Agent Skills 相同,不進微軟生態也能用。聽起來至少還算個「技能草稿產生器」。
但請注意是誰生出這份檔案的:GitHub Copilot。你本來就能直接叫它寫。
兩條路的終點是同一個 AI、同一份檔案
繞路那條要:安裝 Electron 應用程式、在本機編譯 Node、下載 252 MB 的 Whisper 模型、授權螢幕錄製、錄一遍、把畫面送上雲端、等重建、再審一次。
直接那條要:講一句話。
而且繞遠路那條隱私還比較差——打一句話不會外洩任何東西,錄影會把畫面上所有東西一起送出去。
於是整個工具的淨貢獻,是在「跟 AI 說一句話」和「AI 寫出一份技能」之間,插入了螢幕錄製、雲端上傳,和一次影片理解。
六、那,更好的形狀會長什麼樣?
把前面的問題倒過來看,答案其實自己浮出來:
- 錄影之所以必要,是因為 AI 不在現場。那讓它在現場就好了。
- 重建之所以必要,是因為 AI 沒做過那件事。那讓它自己做一遍就好了——做過的人不需要猜自己的意圖。
- 上傳之所以必要,是因為理解影片得靠雲端。沒有影片,就沒有要上傳的東西。
一個 AI 能直接操作、而你同時也看得見的介面:你示範一次,它自己試一次,點錯了你當場說「那個欄位不用填」。這不就是帶新人嗎。兩三輪之後它會了,把流程寫下來,之後交給程式跑——AI 就可以退場了。
AI 只該出現在第一次。
這條路我們正在走,走完再另外寫一篇。
常見問題(查證日期:2026-08-07)
Skill Recorder 是免費的嗎?怎麼收費?
軟體本身免費且開源(MIT 授權),但不是零成本:分析階段由 GitHub Copilot 執行,所以需要一個具備 Copilot 存取權的 GitHub 帳號。Copilot 有免費層,也有 Pro/Business/Enterprise 付費方案。換句話說,工具免費,它依賴的 AI 服務可能要錢。來源:github.com/microsoft/skill-recorder(查證 2026-08-07)。
Skill Recorder 怎麼安裝、怎麼開始用?
它沒有提供編譯好的安裝檔。官方採用原始碼發行:到 GitHub Releases 頁複製對應平台的指令,該指令會下載固定版本的 Node.js、在你自己的機器上編譯該版原始碼,並建立「Skill Recorder (Source)」應用程式。macOS 與 Ubuntu 用 curl 執行 install.sh,Windows 用 PowerShell 執行 install.ps1。首次啟動時 macOS 會要求螢幕錄製權限;接著按 ⌘⇧R/Ctrl+Shift+R 錄製,結束後點 Analyze,第一次會要求登入 Copilot。來源:README 與 INSTALL.md(查證 2026-08-07)。
Skill Recorder 錄下的畫面會上傳嗎?會被拿去訓練 AI 模型嗎?
會上傳,而且是否用於訓練取決於你的 Copilot 方案。錄製、儲存與旁白轉文字都在本機完成,錄的當下不外傳;但一旦按下 Analyze,事件時間軸(視窗與文件標題、網址、剪貼簿預覽)、擷取出的螢幕影像與旁白文字就會送到 GitHub 雲端交給 Copilot 處理。
至於訓練:GitHub 自 2026 年 4 月 24 日起,將 Copilot Free、Pro、Pro+ 使用者的互動資料(輸入、輸出與相關脈絡)用於訓練與改進其 AI 模型,除非使用者主動選擇退出;Copilot Business 與 Enterprise 不在此範圍。GitHub 並未針對 Skill Recorder 另外發布政策,因此應以一般 Copilot 條款理解。README 本身也明文警告不要錄到密碼、權杖與 API 金鑰。來源:skill-recorder README、GitHub 2026-03-25 隱私條款更新公告(查證 2026-08-07)。
Skill Recorder 能自動操作沒有 API 的系統嗎?例如公司內部的 ERP?
不能,這是它最大的落差。它會錄下整個桌面(包含 Excel、終端機與各種原生程式),但它產生的技能只有三種目標,沒有一種能重播原生桌面程式的操作:通用 agent-skill 目標在系統提示中明文禁止瀏覽器自動化,只准用檔案、shell、CLI 與有文件的 HTTP API;Cowork 目標明文寫著它沒有 Playwright 或 browser_* 工具,無法在網頁 UI 點擊或輸入;Scout 目標有瀏覽器自動化,但僅限網頁應用程式,仍碰不到原生視窗程式。能操作桌面 UI 的 Copilot Studio computer use 並未出現在原始碼的目標清單中。來源:electron/architectures/catalogues/(查證 2026-08-07)。
Skill Recorder 產生的 SKILL.md 可以給 Claude Code 之類的其他 AI 工具用嗎?
可以。它的通用目標刻意產生不綁定廠商的技能檔:一份 SKILL.md,含選用的 YAML frontmatter(name 為 kebab-case、description 為觸發關鍵字、allowed-tools 列出可用工具樣式如 Bash(gh *)),後接以祈使句寫給代理看的操作說明。這與 Claude Code 的 Agent Skills 格式相同。但要留意:同一份檔案你也可以直接請 AI 幫你寫,不必經過螢幕錄製與雲端上傳。來源:agent-skill-catalogue.ts(查證 2026-08-07)。
Skill Recorder 跟 Copilot Studio 的 computer use 是同一件事嗎?
不是,兩者是不同產品,方向也相反。Skill Recorder 是開源桌面應用程式,把你的操作翻譯成使用原生工具(CLI、API)的技能文件,刻意避免重播滑鼠點擊。Copilot Studio 的 computer use 則是付費企業服務,2026 年 5 月 13 日正式上線,用視覺模型直接看畫面並點擊網頁與桌面應用程式的 UI,底層模型可選 Anthropic Claude Sonnet 4.5 或 OpenAI 的 CUA。兩者目前沒有整合——Skill Recorder 的原始碼中沒有 Copilot Studio 這個輸出目標。來源:Microsoft Learn: computer use(查證 2026-08-07)。
結論
Skill Recorder 沒有解決任何人的問題,但它把問題的形狀畫得很清楚:真正需要自動化的系統,都是那些沒有 API 的系統;而「沒有 API」正好也代表沒有東西能替你執行。
微軟這一版選擇了「翻譯成原生工具」而不是「重播點擊」——這個選擇在工程上是對的,在市場上卻剛好避開了所有痛點。它承接得了那些你本來就有指令可下的任務,卻承接不了那些你只有滑鼠可用的任務。
所以這不是一個失敗的產品,是一份寫得很誠實的問題說明書。誠實到它在自家的系統提示裡預先寫好了「如果真的必須操作 UI,就在技能裡直說,不要假裝點得到」。
值得追蹤的是下一步:如果哪天 Copilot Studio 的 computer use 出現在那個 catalogues/ 目錄裡,代表微軟決定讓 AI 留在迴路裡點滑鼠。如果沒有,代表他們仍然相信 AI 只該負責翻譯,執行交給程式。那個目錄裡有沒有多一個檔案,就是答案。
本文查證方式
本文所有關於 Skill Recorder 的敘述,均取自 2026-08-07 當日的官方倉庫原文:README、electron/architectures/catalogues/ 下的三份目標能力清單、以及 GitHub API 回報的版本與 release 資料(v0.4.1、2,145 stars、223 forks、30 open issues、七個 release 均無附加檔案)。Copilot Studio 與 GitHub 資料政策部分取自微軟與 GitHub 官方文件,連結見側欄。