音声合成音声編集マルチモーダル基盤モデル

AuK:自然言語指示により音声生成と編集を統一するオープンソース基盤モデル

195万時間の音声データとFlow Matchingにより、生成と編集を単一基盤モデルに統合

AuK Technical Report: An Open-Source Foundational Model for Speech Generation and Editing

論文の書誌情報と関連リンク

読み方の2つの軸

現在:しくみ × 全体像

語彙 使うことば・数式・例え方

直感数式なし
しくみ基礎的な数式
原論文原論文の表現

深さ 研究のどこまで読むか

核心肝だけ
全体像背景から評価
読み解く前提から限界

この2本は、本文下のスライダーからいつでも変更できます。

概要

AuK(オーク)は、声の生成と編集を同じように言葉の指示で行えるオープンソースのAI基盤モデルです。195万時間という大量の音声データから学習し、人の指示に従って自然な声を作ったり、声のトーンや周囲の雑音を直したりできます。

AuKは、テキストからの音声合成(生成)と、既存音声の修正・加工(編集)を同一フレームワークで統合したオープンソース音声基盤モデルです。30億件を超える指示・音声ペアと195万時間の有効データによって学習され、プロンプトひとつで話し手の声質、感情、周囲環境のノイズ特性などを自在にコントロールできます。

AuKは、テキスト指示と音声コンテキストを共通入力として、事前の見本なしの音声生成(TTS)から各種音声編集(音響修正・パラ言語制御・ノイズ除去など)までをカバーするオープンソースの大規模音声基盤モデルです。195万時間の音声コーパスと約30億3,000万件の指示音声ペアにより事前学習され、Rectified Flow Transformerと追加学習(RLHFおよび強化学習)によって高い忠実度と指示追従性を実現しています。

AuKは、テキスト指示と音響コンテキストを入力とし、音声合成および5系統の音声編集タスクを処理するオープンソース基盤モデルです。195万時間・30.3億インスタンスで事前学習され、MMDiT/DiTハイブリッドRectified Flowと一貫性蒸留(AuK-Flash)により高精度・低遅延な音声生成を実現しています。

AuKは、自然言語指示と音響条件を統合インターフェースとして受容するオープンソース音声基盤モデルです。195万時間・30.3億インスタンスのマルチタスクデータセットを用い、意味条件付け用MLLM、音響VAE、ハイブリッドRectified Flow Transformerを組み合わせることで、高品質な音声合成から微細な音響・感情編集までをカバーします。

AuKは、自然言語インストラクションによる条件付けの下で、ゼロショット音声合成、局所内容置換、音響強調・分離、パラ言語・音響特性編集を実行するフルスタックのオープンソース基盤モデルです。195万時間の学習データ、意味条件付けMLLM、音響VAE、およびデュアルストリーム/シングルストリーム混成Rectified Flow Transformerを採用し、DPO/RLポストトレーニングとDecoupled DMD蒸留を経て非常に高い性能と効率を達成しています。

AuKは、自然言語指示と音響コンテキストを入力とする音声生成・編集の統合オープンソース基盤モデルである。195万時間の監督データで事前学習され、MMDiT/DiT混成Rectified FlowとDecoupled DMD蒸留(AuK-Flash)により、ゼロショットTTSから各種音響編集までを高効率に達成する。

本技術報告は、自然言語指示と音響コンテキストを受容し、音声合成および多様な音声編集(内容置換、音響強調、パラ言語制御、音響空間編集)を統一実行するオープンソース基盤モデルAuKを提案する。1.95M時間の音声・3.03B指示ペアによる事前学習、MMDiT/DiT直列Rectified Flow、DPO/RLアラインメント、およびDecoupled DMDによる4ステップ蒸留(AuK-Flash)を特徴とする。

AuKは、共通の自然言語指示プロンプトおよび音響コンテキストインターフェースを通じて、音声生成(ゼロショットTTS等)と広範な音声編集(局所修正・強調・パラ言語・音響変換)を統一的に扱うオープンソース基盤モデルである。約30.3億インスタンス(195万時間)のマルチタスク指示コーパスに基づき、意味条件MLLM、広帯域音響VAE、MMDiT/DiTハイブリッドRectified Flow Transformerを統合。DPO/RLによるポストトレーニングとDecoupled DMDに基づく4ステップ蒸留(AuK-Flash)を通じて、最先端の生成・編集品質と実用的な推論スループットを両立している。

著者をもっと詳しく知る(全6名)

論文と確認可能な公式情報に基づき、著者の所属と研究背景を掲載しています。

全著者と所属

  1. 上海交通大学 (Shanghai Jiao Tong University)
  2. Zhikang Niu
    上海交通大学 (Shanghai Jiao Tong University)
  3. Wenming Tu
    上海交通大学 (Shanghai Jiao Tong University)
  4. Tianrui Wang
    上海交通大学 (Shanghai Jiao Tong University)
  5. 上海交通大学 教授 (Professor, Shanghai Jiao Tong University)
  6. 上海交通大学 准教授 (Associate Professor, Shanghai Jiao Tong University)

確認できた研究背景

所属
: 上海交通大学 (Shanghai Jiao Tong University)
学歴
: 上海交通大学 博士課程
研究の系譜
: Kai Yu、Xie Chen
主な関心
: 音声合成、音声言語モデル、基盤モデル
代表的な論文
: Speech Foundation Models Survey (2024)
関連情報
: 上海交通大学音声研究室にて基盤モデル開発を主導
Zhikang Niu
所属
: 上海交通大学 (Shanghai Jiao Tong University)
主な関心
: 音声生成、Flow Matching
Wenming Tu
所属
: 上海交通大学 (Shanghai Jiao Tong University)
主な関心
: 音声編集、音響モデリング
所属
: 上海交通大学 教授 (Professor, Shanghai Jiao Tong University)
学歴
: ケンブリッジ大学 博士 (PhD, University of Cambridge)
経歴
: ケンブリッジ大学工学部
主な関心
: 音声認識、対話システム、深層学習
代表的な論文
: Speech and Audio Processing Foundations
関連情報
: IEEE Fellow、音声言語処理分野の第一人者
所属
: 上海交通大学 准教授 (Associate Professor, Shanghai Jiao Tong University)
学歴
: ケンブリッジ大学 博士 (PhD, University of Cambridge)
主な関心
: 音声言語モデル、生成音響モデル
関連情報
: 上海交通大学音声研究チームの共同指導教員

なぜ注目されているか

Hugging Faceで200件以上の支持を獲得。声を作るだけでなく『少し早口にして』『雑音を消して』といった編集も指示できるオープンなAIとして話題です。

取得時点でHugging Face上に209件のupvoteを記録。文章から声を生成する機能と、既存の声を加工・修復する機能を1つのAIに統合したオープンソースモデルとして注目を集めています。

Hugging Faceで209 upvotesを獲得し、モデル重みとコードの公開が音声研究コミュニティで歓迎されています。従来の個別ツールに分かれていた音声処理を自然言語の指示で一元化する試みとして議論が活発です。

HF 209 upvotesを記録。Rectified FlowとMLLMを組み合わせ、音声生成と5系統の音声編集タスクを単一モデルに統合したオープン基盤モデルとして関心を集めています。

取得時点でHugging Face上に209件のupvoteを獲得。MMDiTベースのハイブリッドRectified Flowアーキテクチャと195万時間の指示対コーパスにより、ゼロショット生成から音響編集まで統一した技術設計が評価されています。

HF観測値209 upvotes。195万時間の学習データ構築、MMDiTと単一ストリームDiTのハイブリッド構成、Consistency Distillationによる4ステップ推論(AuK-Flash)など、網羅的な技術報告として議論されています。

HF Daily Papers上で209 upvotesを観測。1.95M時間のマルチタスク音声コーパスとRectified Flow Transformerに基づく統合基盤モデル報告として認知されています。

取得時点の観測値はHF 209 upvotes。自然言語インストラクションによる音声合成および編集タスクの統一プロトコル、さらにDecoupled DMDによる4.5倍推論加速手法が技術的焦点となっています。

HF観測値209 upvotes。セマンティック条件付け(MLLM)、アコースティックVAE、dual-stream/single-stream混合DiTのパイプライン構成と、RLHF/強化学習ポストトレーニングの実装体系が検証対象として議論されています。

コミュニティで話されている点(2件)
  • 音声生成と編集を同じプロンプトインターフェースで扱える汎用性と、重みのオープン公開が歓迎された。

    原文を見る ↗
  • 蒸留版モデル(AuK-Flash)の4ステップ推論による高速化がローカル動作の観点で注目された。

    原文を見る ↗
議論全体へのリンク
この読み方に出てくる言葉(3語)
音声編集

すでにある音声の内容、声の調子、雑音などを変える概念。

Rectified Flow

雑音から目的の音声表現までの変化を学ぶ生成方法。

蒸留

大きなモデルの振る舞いを、少ない計算で動くモデルへ移す学習。

どんな問いに向き合ったか

音声生成(TTS)と各種音声編集(音響・話速・感情・強調)は従来別個の専門モデルに分断されており、単一モデルによる自然言語指示での統合的な処理が実現していなかった。

従来の方法と課題

自己回帰型モデルはトークナイザーによる音質劣化や高遅延を抱え、従来の拡散モデルは編集操作の柔軟性に欠けていた。

肝のアイデア

1.95M時間のマルチタスク指示コーパスと、Rectified Flow Transformer(MMDiTとDiTのハイブリッド)により、生成と編集を同一の連続潜在空間Flow Matchingとして統合する。

どういうしくみか

モデル構造は、①意味表現を抽出するMLLM、②音声・音楽・環境音に対応する広帯域音響VAE、③生成本体であるRectified Flow Transformerの3要素から成ります。Transformer層は、テキスト条件と音声潜在変数を個別に処理するDual-Stream MMDiTブロック群と、両者を結合して自己注意を適用するSingle-Stream DiTブロック群のハイブリッドです。学習は生成ウォームアップ→生成・編集同時学習→編集向けDPO+生成向けRLポストトレーニングの3段階で実施。さらにDecoupled DMD技術によりCFG不要の4ステップ蒸留(AuK-Flash)を実現しています。

どう確かめたか

著者らは、ゼロショットTTS評価においてWER 1.89%、コサイン類似度0.841を記録した。VoiceBank-DEMANDにおけるノイズ除去評価でPESQ 3.48、STOI 0.945を達成した。AuK-Flashは4ステップ推論で教師モデル比4.5倍の実時間推論加速を達成した。

何が分かったか

その評価で著者らは、ゼロショットTTSベンチマークにおいて商用APIと同等以上の自然性と話者類似性(SECS > 0.82)。雑音除去・残響除去において専用識別モデルに匹敵するPESQ 3.4+ / STOI 0.94+ を達成。AuK-Flashにより、生成品質を損なうことなく壁時計時間で4.5倍の高速化を達成

どこまで使えるか

適する範囲は自然言語指示による直感的な音声編集と高品質ゼロショットTTSの統合基盤、低遅延な4ステップ推論が求められるインタラクティブな音声対話システム、オープンウェイトに基づく自社ドメイン特化の音声制作パイプラインです。一方、ミリ秒単位の微細な波形修復を要する極限的な音響マスタリング用途、非常に低リソースなエッジマイコンでのリアルタイム推論には適しません。

限界と未解決の問い

音声分離タスクにおいて、オーバーラップの激しい多人数会話では話者追跡に誤りが生じるケースがあります。指示文の表現揺らぎに対する頑健性はではなく、稀な語彙を用いた音響指示では既定値にフォールバックすることがあります。長時間のコンテキスト(>30秒)を処理する際の自己注意計算量が二乗でスケールするため、長尺音声処理にはチャンク分割が必要です。超高周波成分における音響VAEの圧縮損失に伴う微小位相歪み。複雑な論理否定指示に対する指示見落としのリスク。超長文コンテキスト処理における計算量スケーリングの制約。

この研究から考える

ここからは、論文の結果を踏まえた編集上の考察です。

生成と編集の双方で著者らの報告した性能が異なる言語・音響条件でも再現するなら、別々の専用モデルではなく統一モデルを選ぶ根拠になります。ただし、低資源言語、長い音声、潜在表現の圧縮に由来する劣化が残るため、タスク統合そのものが常に有利とは限りません。