Meta 在 2026 年 7 月 7 日推出 Muse Image,同時預覽 Muse Video。這是 Meta Superintelligence Labs 第一批媒體生成模型:Muse Image 已經進入 Meta AI、Instagram Stories 與部分地區的 WhatsApp;Muse Video 仍在開發,尚未對一般使用者開放。
Muse Image 不只是收到提示詞後生成一次圖片。它會先規劃,必要時搜尋網路、撰寫程式產生精確圖形,再檢查結果並決定局部修改或重新生成。Muse Video 則建立在相同的預訓練基礎(pretraining base)上,能直接產生附帶聲音的影片,但 Meta 也列出音畫同步與高速運動的物理正確性仍需改善。
Muse Image 與 Muse Video 的發布狀態
| 項目 | Muse Image | Muse Video |
|---|---|---|
| 目前狀態 | 已發布並逐步推廣 | 早期預覽,尚未正式開放 |
| 主要輸出 | 圖片生成與圖片編輯 | 附帶原生聲音的影片 |
| 目前入口 | Meta AI app、meta.ai、美國 Instagram Stories、部分地區 WhatsApp | 官方表示未來提供給創作者與 Meta AI |
| 開發者 API | 尚未公布 | 尚未公布 |
| 開放權重 | 尚未公布 | 尚未公布 |
| Content Seal | Meta AI 與 meta.ai 生成圖片已加入 | 官方計畫之後擴展到影片 |
Meta Newsroom 表示,一般日常生成可免費使用,想產生更多圖片則會納入 Meta 訂閱方案。不過官方沒有在發布文章列出各地統一的張數、方案價格與排隊條件,實際額度仍以帳號介面為準。Muse Image 也會陸續進入 Facebook、Messenger 和 Advantage+ creative 廣告工具。
從 Emu、Movie Gen 到 Muse
Meta 在 2023 年以 Emu 支撐 Meta AI 的 Imagine 生圖功能,後續的 Emu Edit 與 Emu Video 分別研究圖片編輯和影片生成。2024 年公布的 Movie Gen 再把影片生成、人物個人化、影片編輯與聲音生成整合成一組媒體基礎模型(media foundation models)。
Movie Gen 的技術報告曾公開 30B 影片模型、最長 16 秒與 1080p 等研究規格,聲音模型則是 13B,可依影片與文字生成環境音、Foley 音效和器樂背景音樂。這些數字屬於 2024 年的 Movie Gen,不能直接套用到 Muse Video。Meta 目前只確認 Muse Video 與 Muse Image 使用相同 pretraining base,沒有公布參數量、片長、解析度或正式產品限制。

Muse Image 為什麼被稱為圖片生成 Agent
一般圖片模型會把提示詞直接轉成圖片,結果不理想時需要使用者重新改 prompt。Muse Image 會與 Muse Spark 共同規劃,根據任務選擇搜尋、寫程式、生成圖片或再次編輯。Meta 稱這套做法為 Agent 圖片生成(agentic image generation)。
搜尋補足即時資訊
需要真實人物、近期事件或具體地點時,Muse Image 可以搜尋網頁取得文字與視覺參考。搜尋不代表生成結果一定正確,但能減少模型只靠訓練記憶猜測外觀的情況。官方內部消融測試顯示,加入搜尋後,知識密集型提示的事實準確度會提高。
程式工具處理圖表與 QR Code
文字轉圖片模型擅長畫面風格,卻不適合直接計算座標或保證 QR Code 可掃描。Muse Image 在 reinforcement learning 階段學習撰寫並執行程式,先產生正確圖表、公式或 QR Code,再把渲染結果放進圖片。這和要求模型憑像素猜出資料圖不同。
自我修正與推論階段運算
生成草稿後,Muse Image 會檢查結果。小地方錯誤時可以局部修改;構圖偏離較多時會重新生成;缺少事實資料時則可能改用搜尋或程式工具。Meta 表示這種自我修正不是預先寫死的固定流程,而是在強化學習(RL)訓練中因為能獲得較高回饋而形成。
Meta 的測試也顯示,把更多推論階段運算(test-time compute)花在規劃、工具與修正,效果比單純一次生成多張、再挑最好的一張更能持續提升。這項提升會增加生成時間與計算量。

圖片生成與編輯能力
Muse Image 支援從文字生成圖片、修改單張照片,以及把多張參考圖組合在同一個提示中。參考內容可以是人物、物件、服裝、風格或場景,文字與圖片也能交錯排列,讓模型知道每段說明對應哪張圖。
- 多輪編輯:延續對話內容調整風格、物件與細節,不必每次從頭生成。
- 圈選與手繪指示:在圖片上圈出或畫出要改的位置,再用文字描述修改內容。
- 多張參考圖:把不同人物、服裝、物件與背景組合成新畫面。
- 圖片內文字:官方示範包含活動邀請、海報、資訊圖表與公式,但複雜繁體中文仍應逐字檢查。
- 實際商品搭配:房間改造可以搜尋網路或 Facebook Marketplace 商品,產生放進空間後的示意。
Meta 引用 2026 年 7 月 5 日的 Arena 人類偏好 Elo 排名,表示 Muse Image 當時在 text-to-image、單圖編輯與多圖編輯都是第 2 名。這項名次只代表發布前的時間點,之後可能隨排行榜加入新模型而變動。
Muse Video 的原生聲音是什麼
Muse Video 不是另外附上一款聲音模型,而是影片生成時就能輸出聲音。這裡的 native audio 代表影片與音軌屬於同一套生成體驗,目標是讓動作、場景和聲音對得上,而不是先做無聲影片,再由使用者另外尋找配樂。
官方目前只展示早期預覽,強調提示詞遵循度(prompt adherence)、畫面品質與時間一致性,並引用 2026 年 7 月 5 日 Arena text-to-video 第 3 名。Meta 同時列出兩個仍在改進的問題:聲音與畫面的同步,以及高速運動是否符合物理。這代表原生聲音已經是模型能力,但還不能推論每個動作都會準確對上音效。

Content Seal 與 Instagram 照片爭議
Content Seal 隱形浮水印
透過 Meta AI app 與 meta.ai 產生的 Muse Image 圖片會加入 Content Seal,這是 Meta 的隱形來源標記。官方表示,訊號經過裁切、壓縮、縮放甚至截圖後仍能保留,並預覽一項檢測工具,讓使用者上傳圖片檢查是否含有標記。
Content Seal 的作用是協助判斷圖片是否由 Meta AI 生成,不等於驗證畫面內容真實,也不能證明沒有浮水印的圖片一定由人類創作。重新繪製、極端破壞或其他生成服務的圖片也可能無法由同一套工具辨識。Meta 計畫把 Content Seal 擴展到影片,目前尚未表示 Muse Video 預覽已全面套用。
Instagram 公開照片功能三天後撤回
Muse Image 發布時,Meta 曾宣布可以在 Meta AI 中 @ 提及公開 Instagram 帳號,讓模型引用該帳號的公開照片生成新圖片。即使提供關閉設定,這項設計仍引起本人同意與肖像使用的疑慮。
Meta 在 7 月 10 日更新公告,表示收到使用者意見後已停止提供這項功能。Muse Image 現行功能不再包含 @ 公開帳號,不過仍能使用使用者自己提供、或已取得使用權的多張參考圖;兩種情況需要分開理解。
Muse Image、Muse Spark 與 Muse Glimmer 的關係
Muse Spark 是負責推理、工具使用與多模態理解的模型,Muse Image 專門生成及編輯圖片。兩者可以共同規劃並分享工具,但不是同一個模型換名稱。Meta AI 收到複雜生圖要求時,可以由 Spark 理解任務,再交給 Image 完成媒體生成。
Muse Glimmer 30B 是可下載到本機執行的開放權重 Agent 模型。它能讀取圖片並輸出文字,卻不會生成圖片;需要生圖時仍要連接 Muse Image 或其他圖片模型。Muse Image 與 Muse Video 目前都沒有公開權重,不能因為同屬 Muse 家族就當成本機模型下載。
常見問答
Muse Image 可以免費使用嗎?
Meta 表示一般日常生成可免費使用,更多生成量則屬於訂閱方案。官方沒有在發布公告列出所有國家的固定免費張數與統一價格,應以 Meta AI 帳號顯示的額度為準。
台灣可以使用 Muse Image 嗎?
可以。中央社引述 Meta 表示,Muse Image 已在台灣與部分國家首波推出,可透過 Meta AI 使用。Instagram Stories 與 WhatsApp 的入口仍有各自的地區限制,個別功能也可能依帳號分批顯示。
Muse Image 有 API 或開放權重嗎?
截至 2026 年 8 月 14 日,Meta 尚未公布 Muse Image 的公開 API、模型權重、授權或本機硬體需求。Meta Model API 提供 Muse Spark,不代表同一個 API 已經提供 Muse Image。
Muse Video 已經可以使用嗎?
還不行。Muse Video 目前是早期預覽,Meta 只表示未來會提供給創作者並進入 Meta AI,沒有公布正式日期、國家清單或訂閱條件。
Muse Video 可以單獨生成音效或音樂嗎?
官方目前介紹的是附帶 native audio 的影片生成,沒有宣布 Muse Video 提供獨立的純音效或純音樂介面。Movie Gen 研究曾支援 text-to-audio 與 video-to-audio,但不能因此認定 Muse Video 正式產品會保留相同入口。
Muse Image 生成的文字一定正確嗎?
不一定。Muse Image 可以透過程式工具改善圖表、公式與 QR Code,也比傳統生圖模型更重視文字呈現,但長篇內容、繁體中文、日期與網址仍可能出錯。圖片用於教學、海報或商業素材時,應逐字檢查並實際測試 QR Code。