テキスト読み上げ

文章を貼り付け、声を選んでボタンを押すだけです。合成はすべてブラウザーの中で行われます。システムの声はすぐに話し始め、ニューラル音声は最初に一度だけ読み込みが要りますが、どの端末でも同じ声で、ファイルにも保存できます。

  • 0文字数
  • 0おおよその長さ
  • 0利用できる声

システムの声は保存できません。ブラウザーがサウンドカードへ直接送り、ページには音声ストリームを渡さないためです。ニューラル音声はお使いの端末で作られるので、WAV ファイルとして保存できます。

使い方

  1. 読み上げたい文章を貼り付けるか入力します。
  2. どの端末でも同じ声で聞きたいとき、ファイルを残したいときは、ニューラル音声を入れてください。モデルの読み込みは一度だけで、あとはブラウザーに残ります。
  3. 声を選びます。一覧は端末に入っている言語から作られます。
  4. 既定の読み方が速すぎる・平板だと感じたら、速さと高さを調整します。
  5. 「読み上げる」を押します。一時停止して同じ場所から再開できます。

知っておくと便利

声はどこから来るのか

ブラウザー自身は声を持たず、OS に尋ねます。だから一覧は端末ごとに違います。スマートフォンは通常 1 言語あたり複数の声を持ち、デスクトップの Linux は音声パッケージを入れるまで一つもないことがあります。同時にこれは、文字数の上限も月額も無いという意味でもあります。仕事をするのは、すでにお持ちのソフトウェアだからです。

二つの声、それぞれの代償

システムの声は元から端末に入っていて、押せばすぐ話します。ただし聞こえ方は機械しだいで、素の Linux デスクトップでは一つも入っていないこともあります。ニューラル音声は端末に読み込んで計算するモデルで、日本語には約七十七メガバイトの Piper を使います。どちらの方式でも文章は手元に残り、結果は WAV で保存できます。

長い文章は分けて読みます

記事をまるごと渡すと、音声エンジンは途中で力尽きます。Chrome はキューを押してやらないと 15 秒ほどで止まり、Safari は数百文字から先を捨てます。そこで文の切れ目で分割し、1 文ずつ順番に渡します。文字数で機械的に切ると単語の途中で切れ、それは「どもり」として耳に届きます。

よくある質問

音声をファイルとして保存できますか。

ニューラル音声なら保存できます。音をページの中で組み立てるため、再生器の隣に「WAV をダウンロード」が現れます。システムの声は保存できません。ブラウザーがサウンドカードへ直接送り、ページには音声ストリームを渡さないので、ファイルにする材料がないのです。

一覧に声がありません。どうすれば。

システムに一つも入っていません。Windows は言語の設定から、Android と iOS はアクセシビリティから、Linux は speech-dispatcher の音声パッケージを入れて追加します。そのあとページを再読み込みしてください。一覧は読み込み時に取得されます。

同じ文章が別のブラウザーで違って聞こえるのはなぜですか。

声は OS のものですが、既定の声の選び方、間の取り方、細かな速さはブラウザーが決めるからです。Chrome はネットワーク音声も提供することがあり、より滑らかに聞こえる代わりに接続が要ります。

文章はサーバーへ送られますか。

ページが文章を送ることはありません。ニューラル音声は huggingface からモデルを一度だけ取得し、その後は通信なしで動きます。貼り付けた言葉が端末を出ることはありません。ネットワーク音声と記されたシステムの声は、提供元へ音声を求めることがあります。だからここでは端末内の声を優先しています。

関連ツール