Macのオフライン字幕と文字起こし:Otterの代替
Otterのアプリはオフラインの録音を、アップロード後にしか文字起こししません。音声をMac上に残すなら、Apple Live Captions、MacWhisper、Vocena、Nottaのローカルモードを比べます。
要点
- Otterのモバイルアプリはオフラインで録音できますが、再接続してファイルをアップロードしたあとでなければ文字起こししません。
- 再生中の音声を読むにはApple Live Captionsを使います。Apple siliconのMac、対応言語と地域、初回の言語ダウンロードが必要です。
- 手元にある録音には、オンライン中にダウンロードしたローカルモデルでMacWhisperを使います。
- Vocena(macOS 15.5以降)はライブキャプションを保存し書き出せます。認識はMac上で行われます。クラウド認識はサブスクリプションが必要で、音声をアップロードします。
このページの内容
オフラインのOtter
Otterのモバイルアプリはオフラインで録音できます。ただし文字起こし処理のFAQによれば、処理が始まるのは、再接続してファイルのアップロードが終わったあとです。まだオフラインのあいだに文字が要るなら、音声をMac上で文字にするアプリを使います。

Apple Live Captions
話の内容を追うだけでよければ、ほかのアプリを入れる前に、macOSに入っている字幕ウィンドウを試します。AppleのMac向けLive Captionsガイドには、音声はデバイス上で処理されると書かれています。Live CaptionsにはApple siliconのMacが必要です。使えるのは一部の言語、国、地域に限られます。
- System Settings → Accessibility → Live Captionsを開き、オンにします。初回はMacが言語データをダウンロードするので、オンラインのときに済ませます。
- メニューバーのLive Captionsメニューで、Macで再生されている音はComputer Audio、近くで話している人の声はMicrophoneを選びます。
- 動画か通話を数秒再生し、知りたい箇所が始まる前に、選んだ音源へ字幕が付いてくるか確認します。
字幕が出ないときは、別のアプリを買う前に、選んだ音源と、言語と地域が対応しているかを確認します。
Appleのガイドが書いているのは、画面に文字が出ることです。字幕の保存、書き出し、話者の表示には触れていません。会議のあとに文字起こしが要るなら、下のアプリを使います。Appleは、Live Captionsの精度は変わることがあり、危険の高い場面や緊急時には頼らないようにとも書いています。重要な内容は、話した本人に確認します。
MacWhisper
音声がすでにファイルなら、MacWhisperを試します。インタビュー、ボイスメモ、文字起こししてよい通話などです。ヘルプ記事Keeping Transcriptions Privateには、文字起こしモデルをダウンロードしたあと、話者識別を含む文字起こしが、初期設定ではMac上で行われると書かれています。モデルのダウンロードは、オンラインのときに済ませます。
同じガイドには、Macの外へ出る場合も書かれています。
- クラウドの文字起こしプロバイダを選ぶと、音声はそのプロバイダへ送られます。
- third-partyの翻訳オプションは、文字起こしをその翻訳サービスへ送ります。
- リモートのプロバイダへ送るAIプロンプトには、文字起こしのテキストが含まれます。ローカルのAIプロバイダは例外です。
機密の録音を開く前に、これらの設定を一つずつ確認します。購入前に、ライセンスに含まれる機能も見ておきます。
Vocena
Vocenaは、話を追い、あとから自分で読み返すためのアプリです。会議ボットではなく、通話にも入りません。
macOS 15.5以降のMacで、マイク、Macのシステムオーディオ、またはその両方に同時に字幕を付け、デスクトップのフローティングウィンドウに出します。ライブキャプションは無料で、時間制限はありません。認識はMac上で行われます。使うのはAppleの音声認識か、Qwenのローカルモデルです。モデルは先にダウンロードします。クラウド認識はサブスクリプションに含まれ、音声をアップロードします。
- 翻訳と、読み込んだ音声の文字起こしは有料です。無料の字幕には含まれません。
- ライブキャプションの各行には、マイクかシステムオーディオかが付きます。人ごとには分かれません。Qwenのローカルモデルでは、読み込んだ録音の文字起こしが話者ごとに分かれます。Appleの音声認識では、話者は分かれません。
- セッションは毎回ライブラリへ保存されます。音声が録られるのは録音を開始したあとだけで、止めるのも自分で行います。
音声を録音してあれば、ライブラリの行をクリックすると、その位置から再生できます。文字はTXTで書き出せます。タイムスタンプ付きのSRT字幕には、録音した音声が必要です。録音した音声も書き出せます。
Local Mode
録音、字幕、ライブラリは、初期設定ではデバイス上に残ります。Local Modeはスイッチ一つで、アップロードをすべて止め、クラウドの認識、翻訳、推敲、AIを一時停止します。デバイス上の認識はそのまま動きます。デバイス上の翻訳も動きます。翻訳は有料で、MacではmacOS 26以降が必要です。サインイン、モデルと言語パッケージのダウンロード、クラウドの機能には接続が必要です。オフラインにする前に、使うものをダウンロードしておきます。
Notta
Nottaは、Mac版のNotta Desktopをまだ初期リリースと表示しています。Privacy Modeはコンピュータ上で文字起こしするので、会議の音声をアップロードせずに済みます。ヘルプ記事What is Privacy Mode Recording?には、最初にローカルの保存フォルダを選び、オフラインの音声モデルをインストールすると書かれています。Privacy ModeはPro、Business、Enterprise向けで、無料では使えません。支払い方法によって、使えるかどうかが異なる場合があるとも書かれています。支払う前に、そのプランにPrivacy Modeが含まれるか確認します。
設定はオンラインのときに済ませます。サインインし、フォルダを選び、オフラインの音声モデルをダウンロードします。そのあとは、接続がなくても文字起こしできます。アプリはライセンスをおよそ月に1回確認します。確認ができないときは、使い続ける前に再接続が必要になることがあります。
ローカルのエンジンは二つあります。Notta自身のオフラインモデルには、RAM 4GBとCPUコア2つが必要です。ヘルプ記事には英語、日本語、簡体字中国語、広東語とあり、機能ページには韓国語も載っています。MacがmacOS 26以降なら、代わりにApple Speech Analyzerを選べます。ヘルプ記事では、11言語に対応するとされています。Privacy Modeへの切り替え方は、二つのページで説明が違います。言語とメニューは、使っているバージョンのアプリで確認します。
気になるのがOtterの無料枠なら、Otterの無料プランの上限を見ると、乗り換えなくてよい場合があると分かります。
自分の録音でオフラインを試す
大事な会議の途中でケーブルを抜かず、短いサンプルで確認します。
ライブキャプションでは、アプリが必要とするものをオンライン中にダウンロードします。AppleのMac向けLive Captionsガイドには、初回の設定で言語データがダウンロードされると書かれています。Vocenaのローカルモデルを使うなら、そのモデルもダウンロードします。音源を選びます。Apple Live CaptionsならComputer AudioかMicrophone、Vocenaならシステムオーディオかマイクです。接続を切ってから、自分の録音を再生します。新しい字幕が出続けるか確認します。Vocenaを使い、あとから文字も残すなら、セッションが保存されたかも見て、必要な書き出しを試します。
ファイルを文字起こしするアプリでは、次の順で確認します。
- 自分が所有する録音から、ふだん扱う話し方を含む短いものを選びます。正しく残したい人名、数字、用語を書き出しておきます。
- オンライン中に、モデルか言語データをダウンロードします。サインインするか、ライセンスを有効にします。
- ダウンロードしたローカルモデルを選びます。翻訳、AI、書き出しの設定は、別に確認します。
- Wi-Fiを切り、Ethernetを抜きます。サンプルを文字起こしし、出てきた文字が今回のもので、以前の実行結果ではないことを確認します。
- 結果を閉じて、もう一度開きます。書き出しができるアプリなら書き出し、別のアプリでそのファイルを開きます。
- 使ったMac、macOSのバージョン、アプリのバージョン、モデル、言語、できた手順をメモします。そのあと再接続します。
頼る作業は、それぞれ試します。ファイルのテストでは、ライブキャプション、翻訳、AIの要約がオフラインでどう動くかは分かりません。マイクのテストでは、動画の音がアプリに届くかどうかも分かりません。
何も出ないときは、サンプルに聞き取れる話し声があるか、選んだ入力が合っているか、モデルのダウンロードが終わっているかを確認します。文字に誤りがあるときは、メモと突き合わせます。人名、数字、言語の切り替わり、誰が話していたかです。二つのアプリを比べるときは、実際に使うモードで、同じ録音をそれぞれ通します。


