语音转文字

一段采访、一节课、一条宁愿读也不想再听一遍的语音。录音留在这台设备上——是模型跑到它这边来,而不是反过来。代价是首次约 68 MB,这个数字写在按钮上,而不是藏在按钮后面。

音频或视频都可以,浏览器会自己取出声轨。

录音不会上传:模型下载到你的浏览器,识别也在本地完成。第一次之后断网也能用。

相关工具: 在线录音 · 视频转 MP3 · 音频转换器 · 在线记事本

使用方法

  1. 选择录音——音频或视频都行,声轨我们来取。
  2. 选择说话的语言。首次使用会下载一次模型。
  3. 点击按钮,读一遍文字稿,然后下载为文本或字幕。

实用说明

它听得好的地方和听不好的地方

干净的英语语音上,轻量模型大约每二十个词错一个——这样的文字稿读一遍、改一分钟就能用。俄语、日语、韩语上,即使是录音棚级的输入也会错掉约三分之一的词,因为能塞进浏览器的只有这个轻量模型。页面会在你花掉这次下载之前告诉你属于哪种情况,而不是之后。

为什么是 68 MB,而且没有服务器

所有“瞬间转写”的服务,都会把你的录音送到别人的机器上。采访、就诊记录、家人的语音——为了方便交出这些,代价太大。这里反过来:模型跑到文件这边。下载一次,之后断网也能用,录音也不会变成谁的训练数据。这个选择的代价就是那次下载,而且事先说清楚。

常见问题

我的录音会被上传吗?

不会。模型下载到你的浏览器并在那里运行。第一次之后,页面断网也能用。

为什么俄语的文字稿这么粗糙?

因为轻量模型在俄语上很弱:即使语音干净,也有约三分之一的词是错的。更强的模型存在,但重四倍,浏览器加载不了。页面会在任何下载之前提醒你。

可以生成字幕吗?

可以。除了纯文本,还会生成带时间轴的 SRT 文件。时间轴按三十秒一段,这正是模型真正知道的粒度。

能处理多长的录音?

最长一小时。更长的文件无法整块放进浏览器内存,请先切分。

相关工具