音声を文字に

インタビュー、講義、聞き直すより読みたい音声メッセージ。録音はこの端末に残り、こちらへモデルが来ます。逆ではありません。その代金は初回のおよそ 68 MB で、数字はボタンの上に書いてあります。隠していません。

音声でも動画でも構いません。音のトラックはブラウザが取り出します。

録音はどこにも送りません。モデルをブラウザに落とし、そこで聞き取ります。初回のあとは通信を切っても動きます。

近い道具: オンライン録音 · 動画を MP3 に変換 · 音声コンバーター · オンラインメモ帳

使い方

  1. 録音を選びます。音声でも動画でも、音のトラックはこちらで取り出します。
  2. 話されている言語を選びます。初回だけモデルを取得します。
  3. ボタンを押し、文字起こしを読み、テキストか字幕として保存します。

知っておくと便利

よく聞き取れるもの、そうでないもの

きれいな英語なら、軽いモデルの誤りは二十語に一語ほど。読んで一分直せば使える文字起こしです。ロシア語・日本語・韓国語では、スタジオ並みに澄んだ音でも三割ほどの語を誤ります。ブラウザに収まるのがこの軽いモデルだけだからです。どちらの場合なのかは、通信量を使う前に書いてあります。あとからではありません。

なぜ 68 MB で、なぜサーバーを使わないのか

「すぐ文字起こし」をうたうサービスは、あなたの録音を他人の機械へ送ります。取材、診察、家族の音声。便利さと引き換えに渡すには重すぎます。ここでは逆に、モデルがファイルのところへ来ます。一度落とせば以後は通信なしで動き、録音が誰かのデータセットになることもありません。その選択の代金が、あらかじめ示したあの容量です。

よくある質問

録音はアップロードされますか。

されません。モデルをブラウザに落とし、そこで動かします。初回のあとは通信を切っても使えます。

日本語やロシア語の文字起こしが粗いのはなぜですか。

軽いモデルがそれらに弱いからです。澄んだ音声でも三割ほどの語を誤ります。強いモデルは四倍重く、ブラウザには載りません。ページは取得の前にそのことを告げます。

字幕は作れますか。

できます。素のテキストに加え、時刻つきの SRT が出ます。時刻は三十秒の窓ごとで、モデルが実際に知っている粒度です。

どれくらいの長さまで扱えますか。

一時間までです。それより長いファイルはブラウザのメモリに一度に載りません。先に分割してください。

関連ツール