谷歌推新語音模型

逐行控制台詞表現
25/09/2026
857
收藏
分享
逐行控制台詞表現
逐行控制台詞表現

Gemini 3.8 Flash及Flash-Lite文本轉語音模型支援逐行指令,讓創作者細緻控制每句台詞。

谷歌推出新一代Gemini文本轉語音模型。(網絡圖片)

谷歌推出Gemini 3.8 Flash及Gemini 3.8 Flash-Lite 文本轉語音模型,主打更細緻的聲音控制。開發者不只可指定整段音頻的語氣,亦可逐行設定角色、速度、情緒、停頓和表達方式,讓同一段對話內每句台詞呈現不同效果,減少生成後再剪輯的工作。

新模型面向旁白、有聲書、播客、遊戲角色、教學內容及客服系統等場景。使用者可在提示中為每一行加入導演式指令,例如要求某句壓低聲線、下一句加快節奏,或在關鍵字前後加入停頓。模型會結合文本內容和指令生成連貫音頻,並保持角色聲線的一致性。

Flash主打品質與控制

Gemini 3.8 Flash版本著重自然度、上下文理解及複雜指令,適合需要較高表演質感的長篇內容。模型可理解對話關係和情緒轉折,在多角色場景中分辨說話者,並按標點、段落及逐行設定調整節奏。創作者亦可反覆修改個別台詞,而毋須重新生成整段內容。

Flash-Lite則以較低延遲和成本處理大量請求,適合即時語音回應、短片配音及批量內容製作。谷歌把兩個版本放在同一產品線,讓開發者按品質、速度和預算選擇。對需要大規模生成但控制要求較簡單的工作,可使用Flash-Lite;要求角色表演和細節時則使用Flash。

逐行控制是今次更新的重點。傳統文本轉語音系統多以段落為單位設定風格,同一段內要改變情緒,通常要拆開生成再拼接。新模型把控制指令與台詞放在同一請求內,並處理前後句銜接,方便製作訪談、戲劇和多角色旁白。

面向開發者開放

谷歌透過Gemini API及相關開發平台提供模型,開發者可把生成語音接入應用程式和工作流程。產品介面提供試聽和參數調整,便於在正式部署前比較不同聲線和指令。企業客戶亦可按需要建立模板,把品牌語氣、發音規則和角色設定重複套用。

模型支援多種語言及混合語言文本,並針對數字、縮寫、專有名詞和語調作出處理。對新聞、教育及企業內容,開發者可在輸入中加入發音提示,以降低人名或術語讀錯的機會。谷歌表示,聲音輸出仍須遵守使用政策,涉及合成媒體時應向聽眾作適當披露。

在製作流程上,開發者可先以短片段測試聲線,再把確認後的角色設定套用至長文本。若某一句表達不理想,只需改寫該行指令或台詞,毋須重做其他已完成音頻。這種局部重生成方式亦方便團隊比較版本,保留較合適的語氣和節奏。

文本轉語音市場競爭加劇,平台由「讀得像人」轉向「可按導演要求表演」。Gemini 3.8 Flash 系列透過逐行指令,把過往需要錄音指導和後期剪輯的部分工作前移至生成階段。谷歌表示,將根據開發者測試回饋改善聲線穩定、長文本一致性和即時生成能力。

檢舉
檢舉類型:
具體描述:
提交
取消
評論
發佈

力報會員可享用評論功能

註冊 / 登錄

查看更多評論
收藏
分享

相關新聞

推薦新聞

找不到相關內容

七日預報

↑