Google 在 8 月 27 日發布 Gemini Omni 1.1 Flash,定位為可用於實際製作的影片生成更新。新版本把重點放在「控制」而不只是從文字產生片段:開發者可以延續既有場景、指定開頭與結尾畫面、先用低解析度預覽,再輸出 1080p 或 4K 版本。

影片延伸從 1 秒上下文變成 10 秒

Omni 1.1 的 scene extension 可以分析既有影片最多 10 秒的前段內容,再以 10 秒為單位繼續生成,累計最長可延伸到 40 秒。較長的參考上下文有助於維持角色、場景與敘事方向,但它仍是生成模型,不代表每次延伸都能完美保持連續性。

Google 同時提供可在 Gemini API 中使用的互動流程,開發者可以把上一段影片的 interaction 傳給下一次請求,再用文字描述要如何繼續場景。這讓「從一支短片再往下做」更容易嵌入剪輯器、分鏡工具或自製影片工作流。

首尾幀控制讓鏡頭更像在設計

新版本可指定一個鏡頭的 first frame 與 last frame,模型負責在兩個關鍵畫面之間生成連續運動。對需要鏡頭環繞、推拉、轉場或無縫循環的創作者來說,這比只輸入一段描述更接近傳統分鏡思考。

開發者也能加入最多 3 秒的影片參考,讓角色或動作有額外視覺上下文。這種功能適合做成「拖入參考素材、指定目標畫面、生成版本」的介面,但產品仍應讓使用者檢查角色、動作與畫面連續性。

費用:API 付費方案才可用

這個版本不是免費 API。Google 官方定價頁目前將 gemini-omni-1.1-flash 列在 Gemini API 付費方案:輸入文字、圖片、影片或音訊,每 100 萬 tokens 為 US$1.50;輸出文字每 100 萬 tokens 為 US$9;輸出影片每 100 萬 tokens 為 US$17.50。免費方案不提供這個模型。

影片輸出依 tokens 計費;Google 以 720p 影片每秒 5,792 個輸出 tokens 換算,標準價格約為每秒 US$0.10。以官方 3–10 秒輸出範圍估算,3 秒約 US$0.30、10 秒約 US$1.00;這是估算值,實際金額會依輸出 tokens 與帳戶方案計算。360p 的較低成本則是 Google 公告的相對說明,不能當成另一個固定單價。

先用 360p 測試,再決定是否輸出 4K

Google 表示,360p 預覽最高可比 720p 生成快 60%,成本約為三分之一,適合拿來做分鏡與提示詞迭代。確認方向後,才切換到 1080p 或 4K 輸出,避免把大量預算花在尚未確定的版本上。

Omni 1.1 正逐步進入 Google AI Studio 與 Gemini Enterprise Agent Platform API;Google AI Plus、Pro、Ultra 訂閱者也可在 Flow 使用。不同介面的開放時間、配額與價格仍以實際帳戶與官方文件為準,不能把「已宣布」直接理解成所有地區都無限制開放。

對影片工具開發者的訊息

Gemini Omni 1.1 Flash 的重點,是把影片生成從單次輸出推向可編排的製作流程。延伸、首尾幀、參考影片、低成本預覽與 4K 輸出,讓開發者能設計更接近剪輯與分鏡的產品;但正式交付前仍要處理內容權利、模型限制、畫面一致性與成本控制。

官方細節可參考 Google Gemini Omni 1.1 Flash 公告Gemini API 文件