最終更新:2026年9月12日
この記事の要点
- ローカル文字起こしとは、音声をクラウドへ送らず、PC内だけでテキスト化する方式です。オフラインで動作し、音声・録音・テキストが外部に出ません。
- やり方は2つ。Whisper/faster-whisper を自分で構築する方法(無料・要環境構築)と、AIモデル同梱のインストール不要ソフトを使う方法(ZIPを展開するだけ)です。
- 精度は Whisper large-v3 が最高。faster-whisper(CTranslate2)ならGPUなしでも実用速度で動きます(当サイト実測で約3.7倍高速・約62%省メモリ)。
- 費用はオープンソースなら無料。完全ローカル文字起こしは個人利用が無料、商用・法人は月額500円(税込)です。
- 自分が参加する会話の録音は直ちに違法ではないとされますが、各サービスの規約と参加者の同意に配慮してください(本記事は法的助言ではありません)。
ローカル文字起こしとは?
ローカル文字起こしとは、音声や動画を外部のクラウドサーバーに送信せず、お使いのパソコン(ローカル環境)の中だけでテキストに変換する文字起こしの方式です。クラウド型の文字起こしサービスが、音声をインターネット経由でサーバーへアップロードして処理するのに対して、ローカル文字起こしは録音・音声認識・テキスト保存までのすべての処理をPC内で完結させます。そのため、音声データやテキストが外部に出ることがありません。
音声認識には、OpenAIが公開したオープンソースのAIモデル「Whisper」や、その高速化実装である「faster-whisper」などがよく使われます。これらをPCにインストール(または同梱)しておくことで、インターネットに接続していなくても文字起こしが可能になります。
なお、同じ方式が「オフライン文字起こし」「オンプレミス型の文字起こし」と呼ばれることもあります。前者はネットにつながっていなくても使える点、後者は自社の管理下の環境で処理する点に注目した言い方で、音声を外部のサーバーへ送らないという中身は同じです。この記事では「ローカル文字起こし」で統一して説明します。
ローカル文字起こしのメリット・デメリット
メリット
- 情報漏えいリスクが小さい:音声・テキストを外部に送信しないため、機密会議や個人情報を扱う現場でも安心。
- オフラインで動作:ネットワークが無い環境・クラウド送信が禁止された環境でも使える。
- 追加の従量課金がない:処理時間に応じた料金が発生しないため、長時間・大量の音声でもコストが読める。
- 規程・コンプライアンスに通しやすい:データを端末外に出さないため、情シスや監査の審査を受けやすい。
デメリット・注意点
- PCの性能に依存:処理速度はCPU/GPUの性能に左右される(GPUがあると高速)。
- 自前構築はハードルが高い:Whisperを自分で動かすにはPythonやCUDAなどの環境構築が必要。
- 話者識別・要約などは別途必要な場合がある(ツールにより対応状況が異なる)。要約もローカルで行う方法はローカルAI要約ガイドを参照。
※ 環境構築のハードルは、AIモデルを同梱したインストール不要のソフトを使えば回避できます。
クラウド型文字起こしとの違い
クラウド型(Notta・CLOVA Note・Rimo Voice 等)は、話者識別や自動要約などの機能が充実している一方、音声をサーバーへアップロードする前提のため、クラウド送信が禁止された案件では利用できないことがあります。ローカル型は機能数より「データを外に出さないこと」を最優先する用途に向いています。
| 観点 | ローカル型文字起こし | クラウド型文字起こし |
|---|---|---|
| 音声データの送信 | 送信しない(PC内で完結) | サーバーへ送信して処理 |
| オフライン利用 | 可能 | 不可(通信が必要) |
| 情報漏えいリスク | 小さい | 送信・保管に伴うリスクあり |
| 料金 | 無料〜買い切り/定額が中心 | 従量課金・月額が中心 |
| 話者識別・自動要約 | ツールにより対応が分かれる | 充実していることが多い |
| 処理速度 | PC性能に依存 | サーバー側で安定 |
なお、ローカル型でも WhisperX を使えば話者識別(誰の発言か)を、ローカルLLMを併用すれば自動要約を実現できます。出力もテキスト(.txt)・字幕(.srt)・タイムスタンプ付きなど複数形式に対応でき、必ずしもクラウド型に機能で劣るわけではありません。本ソフト「完全ローカル文字起こし」も Ver.4.0.0 からローカルLLMによる要約機能を内蔵しており、文字起こしから要約まで外部送信ゼロで完結します。要約側の仕組み・手順・プロンプト例はローカルAI要約ガイドで解説しています。
ローカルで文字起こしをする2つの方法(やり方)
ローカルで文字起こしをする方法は、大きく分けて2通りあります。技術的な知識の有無で選ぶとよいでしょう。
方法A:Whisper / faster-whisper を自分で構築する(上級者向け)
オープンソースのWhisperを自分のPCに導入する方法です。無料で柔軟にカスタマイズできる反面、環境構築の知識が必要です。一般的な手順は次のとおりです。
- Python(3.10〜3.11 など)をインストールする。
- 音声デコード用に FFmpeg を用意する。
pip install faster-whisperなどで音声認識ライブラリを導入する。- GPUで高速化する場合は、対応する CUDA / cuDNN と PyTorch を準備する(CPUのみでも動作可)。
- モデル(tiny〜large-v3)を選び、文字起こしスクリプトを実行する。
※ 話者分離やタイムスタンプが必要な場合は WhisperX、リアルタイム処理には whisper.cpp や whisper_streaming などの派生実装が使われます。いずれもセットアップやコマンド操作の知識が前提となります。
方法B:インストール不要の専用ソフトを使う(非エンジニア向け)
AIモデルをあらかじめ同梱したソフトを使えば、環境構築なしでローカル文字起こしを始められます。プログラミングやGPUの知識は不要で、ITに詳しくない方でも扱えます。
たとえば当サイトの「完全ローカル文字起こし」は、Whisper large-v3 を含むAI一式を同梱したWindows向けソフトで、インストール不要(ZIPを展開するだけ)・GPU不要・オフラインで動作します。フォルダに音声を入れるだけで自動的に文字起こしが始まり、Ver.3.0.0 からは会議・通話をアプリだけで録音(マイク+PC内音声 / Teams・Zoom 等)して、その場で文字起こしすることもできます。

無料でローカル文字起こしする方法
ローカル文字起こしは無料で始められます。
- Whisper / faster-whisper(オープンソース):MITライセンスで無料。ただし前述のとおり自分で環境構築が必要です。
- インストール不要のソフトの無料枠:完全ローカル文字起こしは個人利用が無料(商用・法人利用や、自動文字起こしフォルダ・単語登録などの一部機能はライセンス登録が必要)。環境構築せずに無料でローカル文字起こしを試したい場合に向いています。
精度と速度(Whisper / faster-whisper)
音声認識の精度は、使用するモデルと音声品質で大きく変わります。OpenAIのWhisper large-v3は、雑音のある環境でも高精度に認識でき、日本語を含む多言語に対応します。精度を上げるコツは、できるだけクリアに録音すること、そして専門用語・固有名詞を単語登録(辞書)で補正することです。
Whisperには精度と必要リソースの異なる複数のモデルがあり、用途に応じて選びます。
| モデル | 精度 | 速度・必要リソース | 向いている用途 |
|---|---|---|---|
| tiny / base | 低〜中 | 軽い(低スペックPCでも可) | 下書き・とりあえずの確認 |
| small / medium | 中〜高 | 中程度 | 精度と速度のバランス重視 |
| large-v3 | 最高 | 重め(メモリ多め・GPU推奨) | 高精度が必要な議事録・字幕 |
※「完全ローカル文字起こし」は標準で large-v3 を採用し、faster-whisper の最適化によりGPUがなくても実用的な速度で動作します。
速度面では、faster-whisper(CTranslate2ベース)が標準のWhisperより高速かつ省メモリで動作します。GPUがあればさらに高速ですが、CPUのみでも実用的に動作します。参考までに、完全ローカル文字起こしでは推論エンジンの刷新により、同じ large-v3 の精度を保ったまま約3.7倍の高速化・約62%のピークメモリ削減を実測しています(計測条件はリンク先参照)。
必要なPCスペックと空き容量の目安
ローカル文字起こしでは、AIモデルを自分のPCのメモリに読み込んで計算します。そのため必要なスペックは、どのモデルを使うかでほぼ決まります。考え方の目安は次のとおりです。
- メモリ(RAM):モデルが大きいほど多く必要になります。large-v3 クラスのモデルは読み込むだけで数GBを占めるため、他のアプリと並行して使うなら余裕を見ておくと安定します。
- ストレージ:モデルファイル自体が大きく、数GB規模の空き容量が必要です。要約用のローカルLLMも一緒に持つ構成では、さらに増えます。
- CPU / GPU:GPUがあれば処理は速くなりますが、faster-whisper のようにCPU向けに最適化された実装なら、GPUがなくても動作します。社用PCやノートPCで始めるなら、まずCPUのみで試して速度を確かめるのが現実的です。
参考として、「完全ローカル文字起こし」の必須環境は Windows 10 / 11(64bit)または Windows Server、4コアCPU、RAM 8GB。ストレージは通常版が展開後 約3.9GB、要約機能付き版が展開後 約10.3GB の空きです。ZIPを展開する作業中は展開前と展開後の両方が一時的に必要になるため、安全マージンを含めるとそれぞれ合計 約8GB以上/約21GB以上を見ておくと安心です。推奨環境は 8コアCPU・RAM 16GB・NVIDIA RTX 30系以上のGPUですが、GPUは必須ではなく、CPUのみでも全機能が動作します。内訳はよくある質問「推奨される動作環境(GPU・RAM・ストレージ)は?」で確認できます。
※ 上記は本ソフトの数値です。Whisper を自分で構築する場合に必要なメモリ・容量は、選ぶモデルと実装によって変わります。
Mac・スマートフォンでもローカル文字起こしはできる?
ローカル文字起こしはWindowsだけの考え方ではありません。ただし、使えるソフトはOSごとに分かれます。手元の端末に合うものを選ぶ必要があります。
- Windows:Whisper / faster-whisper を自分で構築する方法のほか、AIモデルを同梱したソフトを使う方法があります。
- Mac:MacWhisper のようにMac向けに作られたローカルアプリがあり、処理はすべて端末内で行われます。Windows向けのソフトはそのままでは動きません。
- Linux:Whisper / faster-whisper / whisper.cpp などのオープンソース実装を自分で動かす形が中心です。
- スマートフォン:端末内で音声認識を行うアプリもありますが、見た目が似ていてもクラウドへ送信して処理するアプリも少なくありません。「音声を外部に送信しない」と明記されているかを、導入前に確認してください。
※「完全ローカル文字起こし」は Windows / Windows Server 向けのソフトで、Mac・スマートフォンには対応していません。
安全性とセキュリティ
ローカル文字起こしが「安全」とされるのは、技術的な裏付けがあります。音声の変換・文字起こし・結果表示までのすべての処理をPC内で完結させ、外部サーバーやクラウドAPIへの通信を一切行わない設計であれば、通信の傍受やクラウド側からの情報漏えいといったリスクを構造的に排除できます。保存先もユーザーが指定したフォルダに限定され、ネットワークに接続していなくてもフル機能で動作します。
さらに堅牢にしたい場合は、出力テキストを保存するドライブを OS 側で暗号化(WindowsのBitLocker など)し、共有フォルダでは暗号化通信とアクセス権設定を組み合わせる運用が有効です。リスクの所在の整理、クラウド型サービスを使う前の確認項目、情シスの審査で問われることは文字起こしセキュリティガイドにまとめています。
録音と法律(秘密録音は違法?)
会議や通話を録音して文字起こしする際に気になるのが法律面です。一般に、自分が参加している会話を相手に告げずに録音する「秘密録音」は、それ自体が直ちに違法になるわけではないとされています。一方で、次のような行為は問題になり得ます。
- 自分が参加していない他人の会話を盗聴・録音する。
- 録音データを無断でSNSに公開・拡散する(プライバシー侵害・名誉毀損のおそれ)。
- 住居への無断侵入など、不当な手段で録音する。
また、Web会議サービスの規約や勤務先のルールで録音が制限されている場合もあります。録音・文字起こしを行う際は、利用環境のルールや各サービスの規約に従い、必要に応じて参加者の同意を得たうえでご利用ください。
※ 本記事は一般的な情報であり、法的助言ではありません。具体的な事案については弁護士など専門家にご相談ください。
ローカル文字起こしツールの選び方
「ローカル」とうたっていても、中身の作りは製品ごとに異なります。導入前に次の点を確かめておくと、あとから「実は一部を送信していた」「業務では使えなかった」といったズレを避けられます。
- 本当に外部送信がないか:ライセンス認証やクラウドAIの併用など、一部だけ通信する作りのものもあります。ネットワークを切った状態で動くかを実際に試すのが確実です。
- 環境構築が必要か:Python や CUDA の準備が要るのか、ZIPを展開するだけで動くのか。ITに詳しくない方が使うなら、ここが一番大きな差になります。
- GPUが必須か:社用PCにGPUが載っていないことは珍しくありません。CPUのみで動くかを確認しておきます。
- 商用・法人で使える条件か:個人利用と業務利用で条件が違うことがあります(本ソフトの条件は価格ページをご覧ください)。
- 必要な出力形式に対応しているか:テキスト(.txt)、字幕(.srt)、タイムスタンプ付きなど、後工程に合う形式で出せるか。
- 文字起こしの先まで必要か:書き起こしだけで足りるのか、話者分離や要約まで自動化したいのかで、選択肢が変わります。
情シスの審査で問われる項目や、クラウド型を使う前の確認事項は文字起こしのセキュリティリスクをまとめたガイドで整理しています。実際にどんな現場で使われているかは導入事例、細かい仕様はよくある質問もあわせてご覧ください。
ツール比較表
代表的なローカル文字起こしの選択肢を、導入のしやすさの観点で整理しました。
| タイプ | 例 | 環境構築 | 費用 | 向いている人 |
|---|---|---|---|---|
| オープンソースを自前構築 | Whisper / faster-whisper / WhisperX | 必要(Python・GPU等) | 無料 | 開発者・カスタマイズしたい人 |
| インストール不要の専用ソフト | 完全ローカル文字起こし | 不要(ZIP展開のみ・GPU不要) | 個人無料/商用 月500円 | 環境構築せず使いたい人・業務利用 |
| クラウド型(参考) | Notta / CLOVA Note 等 | 不要 | 従量・月額が中心 | 話者識別・要約を重視(送信可の場合) |
各ツールの機能差はトップページの比較表もあわせてご覧ください。
よくある質問
あわせて読みたい
- Whisper を Windows で使う方法:自前構築とインストール不要ソフトの違い、GPUの要否、日本語精度の上げ方
- Teams・Zoom・Google Meet の会議を録音して文字起こしする方法:相手の声(PC内音声)の録り方と手順
- 文字起こしソフト比較 2026:ローカル型とクラウド型の違いと選び方、主要ツールの対応表
- ローカルAI要約ガイド:文字起こし結果をクラウドに送らず要約する方法
- 文字起こしセキュリティガイド:リスクの所在と、クラウド型を使う前に確認する7項目
- 文字起こし・ローカルAI 用語集:話者分離・ローカルLLM・GGUF など30語