Tier 2: 現代の標準技術マルチモーダル・音声AIHF 620 votes
Whisper音声認識弱教師あり学習

大規模弱教師あり学習による頑健な音声認識(Whisper)

インターネット上の68万時間の音声と弱ラベルテキストを事前学習。方言や環境ノイズをものともせず文字起こしと翻訳の常識を塗り替えた音声界のTransformer

Robust Speech Recognition via Large-Scale Weak Supervision

論文の書誌情報と関連リンク

読み方の2つの軸

現在:しくみ × 全体像

語彙 使うことば・数式・例え方

直感数式なし
しくみ基礎的な数式
原論文原論文の表現

深さ 研究のどこまで読むか

核心肝だけ
全体像背景から評価
読み解く前提から限界

この2本は、本文下のスライダーからいつでも変更できます。

概要

Whisperは、インターネットから集めた68万時間の音声と文字の組を使い、雑音や話し方が変わっても使いやすい音声認識を目指した研究です。

Whisperは、人が丁寧に整えた少量の教材ではなく、多少の誤りを含む68万時間の音声データから学びます。著者らは、追加学習なしで複数の音声認識・翻訳テストを評価しました。

Whisper論文は、大量だが不完全な音声と字幕を使う学び方、多言語・翻訳・時刻情報を一つのモデルで扱う方法、未知のデータでの評価を説明します。長い音声や誤った字幕には限界があります。

Whisperは、68万時間の弱教師あり音声データで学習したencoder-decoder Transformerをzero-shotで評価した研究です。

Whisperはlog-Mel音響特徴をencoderへ入力し、言語・タスク・timestamp tokenをdecoder promptで指定します。多様なASR・音声翻訳データセットで教師ありモデルと比較されました。

本論文は、大規模weak supervision、multitask sequence-to-sequence形式、zero-shot transferの関係を検証します。平均性能だけでなく、30秒窓、長音声、データノイズ、言語別の差を読む必要があります。

Whisper論文は、680,000 hoursのweakly supervised audio-text pairsで学習したrobust speech recognition modelを報告します。

モデルはaudio encoderと言語decoderからなるsequence-to-sequence Transformerで、special tokensによりtranscription、translation、language ID、timestamp predictionを統一します。

本論文の中心は、weak supervisionを大規模化したときのzero-shot robustnessです。複数benchmarkのWERとtranslation結果を、データ構成、windowing、decoding条件、言語別失敗と対応づけて読みます。

Alec RadfordOpenAI
Jong Wook KimOpenAI
著者をもっと詳しく知る

論文と確認可能な公式情報に基づき、著者の所属と研究背景を掲載しています。

Alec Radford
所属
: OpenAI
学歴
: OpenAIリサーチサイエンティスト。GPT、GPT-2、CLIP、Whisperの主著者。
研究の系譜
: 自己教師あり学習・マルチモーダル表現学習の先駆者。
代表的な論文
: Whisperの学習設計、データセット構築、モデル訓練の主導
Jong Wook Kim
所属
: OpenAI
学歴
: OpenAIリサーチサイエンティスト・エンジニア。
研究の系譜
: 音声信号処理と深層学習スケーリングの専門家。
代表的な論文
: 大規模音声前処理パイプラインとデコーダ推論の実装

なぜ歴史的イノベーションなのか

OpenAIがモデルと推論コードを完全オープンソース化し、whisper.cppをはじめとする軽量化実装と共に世界中のソフトウェアに組み込まれました。

OpenAIがモデルと推論コードを完全オープンソース化し、whisper.cppをはじめとする軽量化実装と共に世界中のソフトウェアに組み込まれました。

OpenAIがモデルと推論コードを完全オープンソース化し、whisper.cppをはじめとする軽量化実装と共に世界中のソフトウェアに組み込まれました。

OpenAIがモデルと推論コードを完全オープンソース化し、whisper.cppをはじめとする軽量化実装と共に世界中のソフトウェアに組み込まれました。

OpenAIがモデルと推論コードを完全オープンソース化し、whisper.cppをはじめとする軽量化実装と共に世界中のソフトウェアに組み込まれました。

OpenAIがモデルと推論コードを完全オープンソース化し、whisper.cppをはじめとする軽量化実装と共に世界中のソフトウェアに組み込まれました。

OpenAIがモデルと推論コードを完全オープンソース化し、whisper.cppをはじめとする軽量化実装と共に世界中のソフトウェアに組み込まれました。

OpenAIがモデルと推論コードを完全オープンソース化し、whisper.cppをはじめとする軽量化実装と共に世界中のソフトウェアに組み込まれました。

OpenAIがモデルと推論コードを完全オープンソース化し、whisper.cppをはじめとする軽量化実装と共に世界中のソフトウェアに組み込まれました。

コミュニティの評価・歴史的インパクト(1件)
  • 方言もBGM混じりの会話も正確に文字に起こせる。研究用ベンチマークではなく、現実世界でそのまま動く本物の音声AI。

    原文を見る ↗
この読み方に出てくる言葉(6語)
事前学習

大規模データから一般的な予測能力を獲得する学習段階。

トークン

言語モデルが入出力を扱う離散的な単位。

ベンチマーク

モデル性能を比較する標準化された評価課題。

ゼロショット

対象タスクの例示や追加学習なしで解く設定。

音声認識

音声波形からテキスト列を推定する処理。

Transformer

注意機構を中心に系列を処理するニューラルネットワーク。

どんな問いに向き合ったか

従来の自己教師あり表現学習(wav2vec 2.0等)は良質な線形プロービングやファインチューニングを要しましたが、Whisperは弱教師あり事前学習のみで直接下流タスクを解くゼロショット汎化を確立しました。

従来の方法と課題

この研究が比べた従来案と課題は、提案の説明では次のように位置づけられています。

従来の自己教師あり表現学習(wav2vec 2.0等)は良質な線形プロービングやファインチューニングを要しましたが、Whisperは弱教師あり事前学習のみで直接下流タスクを解くゼロショット汎化を確立しました。

肝のアイデア

・ヒューリスティックなテキストフィルタリングによるインターネット弱教師ありコーパスの構築パイプライン

・言語識別、書き起こし(Transcribe)、英語への翻訳(Translate)を同一語彙空間で完結させるマルチタスクプロンプティング

どういうしくみか

入力音声は16kHzでリサンプリングされ、25msウィンドウ・10msホップの80チャネルLog-melスペクトログラムに変換。Encoder冒頭の2層畳み込み(Stride 2)で時間軸を4倍ダウンサンプリング(1秒=50フレーム)。Decoderは自己回帰言語モデルであり、プレフィックスプロンプトによって動作モードを制御します。タイムスタンプは0.02秒刻みの特殊トークン(<|0.00|>, <|0.02|>, ...)として語彙に追加され、クロスアテンションの重みから単語ごとの発話タイミングを抽出します。

どう確かめたか

著者報告の結果は次の評価条件に基づきます。

・人手評価者(プロの書き起こし者)との比較において、英語雑音環境での単語誤り率が人間とほぼ一致

・FLEURS多言語ベンチマークにおいて、多言語音声認識精度が自己教師あり事前学習+教師ありファインチューニングモデルを凌駕

何が分かったか

著者報告の結果は次の評価条件に基づきます。

・モデルサイズ(Tiny 39MからLarge 1550M)のスケーリングに従い、ゼロショットWERがべき乗則に従って単調減少することを実証

どこまで使えるか

この結果が直接支えるのは、論文が評価した課題と比較条件です。別の用途へ広げる場合は、同じ傾向が保たれるかを改めて測る必要があります。

・リピテーションおよび信頼度低下を監視し、探索温度を 0.00.2...1.00.0 \to 0.2 \to ... \to 1.0 と遷移させるTemperature Fallbackアルゴリズム

限界と未解決の問い

・長文オーディオの逐次処理時に、先行する誤りや幻覚が後続ウィンドウのプロンプトとして連鎖するエラー伝播問題

・30秒単位のチャンク分割処理を前提とするため、100ms未満の超低遅延リアルタイム音声会話への直接適用には制約がある

この研究から考える

ここからは、論文の結果を踏まえた編集上の考察です。

Whisperは追加学習なしの複数データセットで、教師ありモデルと競合する音声認識結果を報告しました。この観察が自分のデータと計算条件でも保たれるなら、少量の整ったデータだけでなく、多様で不完全な大規模データを使う選択肢を検討できます。30秒窓、長音声、言語別性能、学習データのノイズが適用範囲を制限しますので、同じbaselineとmetricでの比較が前提です。