前陣子在 Threads 上看到一段分享,說 Fable 的產品發佈影片完全由 AI 剪輯,負責人 Thariq 甚至沒有打開過 Premiere 或 Final Cut。作為一個平時會寫點 script 處理重複工作的人,我馬上被吸引了:這到底是真正的革命,還是另一波 AI hype?
我花了點時間研究這個案例,也試著梳理出一套可以跟著做的流程。結論是:yes and no——取決於你對「剪片」的定義。
「AI 剪片」的真正意思:寫程式,而不是按時間軸
Claude Code 沒有預覽視窗,也不能像 Runway 或 Adobe Firefly 那樣直接生成畫面。它真正擅長的,是讀取你的檔案系統、執行命令、看到錯誤訊息後修正,然後再試一次。換句話說,它不是在「剪」片,而是在幫你編排一條由程式驅動的影片處理 pipeline。
這種方式最適合處理技術性、重複性高的工序,例如:
- 用 ffmpeg 批量轉檔、裁切、合併片段
- 自動生成字幕並燒錄到畫面
- 統一格式、解析度與幀率
- 音訊標準化或加上浮水印
但如果你期望它「把這段訪問剪得更有情緒」或「找出最好的 take 來做預告片」,它現階段是做不到的。它沒有眼睛,也無法感知節奏、表演或故事張力。
Fable 團隊的實際做法:五個自動化步驟
根據 @ai_tjb 的整理,Thariq 把十七個未分類的 camera takes 全倒進一個資料夾,沒有標記、沒有場景分類,然後給了 AI 一個指令。之後的工作分成五步:
- 自動轉錄:把 25GB 的素材餵給免費的本地轉錄工具,生成帶精確時間戳的逐字稿。這份 transcript 成為整個 workflow 的骨幹。
- 智慧選鏡:AI 派出多個平行助手分析逐字稿,自動捨棄帶有口吃、填充詞(um, ah)的片段,挑選最流暢、結尾最乾淨的 take,並生成一份對照表,註明每段用哪個檔案、從第幾秒到第幾秒,以及選擇原因。
- 拼接粗剪:用免費工具把選好的片段按時間線組合成 rough cut。
- 調色與動態圖形:由於 Thariq 不懂調色,AI 寫了參數並搭了一個簡易網頁,讓他用滑桿調整飽和度與明暗,數值自動回傳到處理流程。靜態設計檔也經由網頁程式碼動起來,並根據逐字稿的時間戳,精準對位到旁白——例如當講者說出「right」這個字時,圖形剛好彈出,完全沒有手動拉時間軸。
- 自動更新與輸出:設計師傳來新素材後,AI 自動替換並輸出最終的 4K 影片。
這個案例最讓我驚訝的不是「AI 會剪片」,而是 AI 會為了完成任務,自己建造輔助工具(例如那個調色介面)。這正是 agentic AI 的核心:它不是去控制剪接軟體,而是去編排一整串的轉錄、分析、編程與媒體處理工具。
想自己試?需要準備的工具
如果你也想動手,這是無法跳過的基本配備:
- Claude Code:這是獨立的 CLI 工具,不是網頁版聊天介面。安裝指令是
npm install -g @anthropic-ai/claude-code。 - ffmpeg:真正的影片處理引擎,負責裁切、合併、轉碼、調色。Mac 可用 Homebrew 安裝,Windows 可用 winget。
- Whisper:OpenAI 開源的本地轉錄工具,用來生成帶時間戳的逐字稿。建議可考慮 WhisperX 或 faster-whisper,以取得更精準的字級時間戳。
- Python 環境:Claude Code 會幫你寫 script,但你本機需要能執行 Python。
誠實說,第一次設定環境和排解錯誤的時間,可能比直接打開 Premiere 手動剪完一條片還要長。魔法通常發生在第三、第四個項目,當你的流程變得可重複,那時你真的只需要把檔案丟進資料夾,然後說「照上次那樣做」。
我整理出的務實工作流程
綜合了原始教學與後續的技術修正,我認為最值得記下的流程長這樣。不必一次跑完全部,分階段來會更穩:
第一階段:建立骨架
把所有原始片段放進 ./raw_clips,然後讓 Claude Code 寫一個 Python script,用 Whisper 轉錄所有影片,輸出一份 transcription.json。這份檔案要包含:檔名、每句話的內容、起訖時間,以及備註時間戳的精確度(片段級或字級)。
第二階段:選鏡與決策
讓 AI 讀取 transcription.json,按內容主題分組,再從重複拍攝的 takes 中挑選最乾淨的版本。評選標準要務實:最少填充詞、最少重開機或結巴、句子最完整。最後輸出一份 edit_decisions.json,標註每個片段用哪個檔案、從第幾秒到第幾秒,並附上簡短理由。
這裡有個關鍵修正:AI 能從文字判斷流暢度,但無法從逐字稿看見你的表情、眼神或聲音能量。所以我的做法是讓 AI 在決策表裡加上信心分級——「高信心」直接採用,「中信心」或「需要人類審核」的標記出來,最後由我快速掃一眼確認。
第三階段:組合與對位
用 ffmpeg 把選好的片段裁切出來,統一解析度、幀率與音訊規格後,再串接成 rough cut。這裡很容易出錯:如果片段的格式不一致,直接 concat 會失敗。務必先將每段素材 normalize 到相同規格(例如 1920×1080, 30fps, 48kHz AAC),再進行合併。
同時,請 AI 建立一份 timeline_map.json:記錄每個原始片段在 rough cut 裡的新起訖時間。這份對照表是後續加字幕、加圖形時的依據,否則時間戳會全部錯位。
第四階段:調色、音效與輸出
基礎的顏色與音訊調整可以透過 ffmpeg 濾鏡完成,例如統一提升飽和度、做 EBU R128 響度標準化(-16 LUFS 是網路影片的務實起點)。如果你像 Thariq 一樣不懂調色,可以請 Claude Code 寫一個帶滑桿的簡易 HTML 頁面,讓你拖曳出喜歡的數值後,自動生成對應的 ffmpeg 指令。
最後輸出時,建議直接採用工作解析度。如果原始素材是 1080p,就不要為了追求 4K 而強制放大,徒增渲染時間與檔案體積。
這個方法最適合什麼影片?
經過一輪整理,我認為這套 workflow 的甜蜜點非常明確。它最適合「結構清晰、以語音為主、需要從大量重複 take 中組合出乾淨版本」的影片:
- Talking-head YouTube 影片:你錄了五段十分钟的評論,AI 幫你挑出每段最流暢的詮釋,去掉「讓我重來一次」。
- 線上課程或教學:去掉失誤與停頓,自動加上章節標題與字幕,輸出統一格式的課堂影片。
- Podcast 與訪談精華:從九十分鐘的訪談中找出十個主題片段,生成社交媒體用的短 clip 與字幕。
- 企業內部影片:產品 demo、銷售會議、培訓內容。這類影片重視一致性與效率,創意剪接的需求較低。
- 批量處理固定格式的週更影片:每週的市場更新、健身教學、房產導覽。只要 pipeline 建好,之後就是丟檔案、等輸出。
相對地,以下類型現階段還是交給人類編輯比較好:
- 音樂 MV 或節奏蒙太奇:AI 可以偵測拍子,但「對到情緒」是另一回事。
- 婚禮或紀錄片:需要判斷眼神、情感與故事弧線,這無法從逐字稿讀出。
- 劇情片或高端廣告:B-roll 的選擇、視覺連戲、情緒節奏,都太依賴主觀品味。
把流程修得更穩:三個容易忽略的細節
在進一步研究技術討論後,我記下了三個能讓這個 workflow 從「酷炫實驗」變成「真正可用」的修正:
- 建立時間軸映射表:沒有
timeline_map.json,你加字幕或圖形時一定會對錯時間。這份檔案是銜接原始素材與最終時間線的橋樑。 - 加入人類審核檢查點:在輸出最終影片前,強制暫停,先讓 AI 展示
edit_decisions.json給你看。確認沒有選到明顯失常的 take,再繼續。 - 先統一格式再合併:ffmpeg 的 concat 對編碼參數很敏感。不要直接串接不同解析度或幀率的片段,先 normalize 再合併,能避免大量無謂的 troubleshooting。
結語:一個可以立刻行動的小建議
如果你看完也想試,不要一開始就模仿「把十七條片段丟進資料夾」的壯舉。先準備兩三段三分鐘的 talking-head 影片,在本機裝好 ffmpeg 和 Claude Code,然後給它一個最簡單的指令:「幫我寫一個 Python script,用 Whisper 轉錄這幾條片,選出最流暢的 take,組合成一條 rough cut,並存成 JSON 讓我檢查。」跑通這一小段,你就會清楚知道這套工具的邊界在哪裡——以及它是否真的值得你建立下一套自動化流程。