语音转文字
一段采访、一节课、一条宁愿读也不想再听一遍的语音。录音留在这台设备上——是模型跑到它这边来,而不是反过来。代价是首次约 68 MB,这个数字写在按钮上,而不是藏在按钮后面。
- 免费
- 文件不会离开你的设备
- 无需注册
- 不限文件数量
使用方法
- 选择录音——音频或视频都行,声轨我们来取。
- 选择说话的语言。首次使用会下载一次模型。
- 点击按钮,读一遍文字稿,然后下载为文本或字幕。
实用说明
它听得好的地方和听不好的地方
干净的英语语音上,轻量模型大约每二十个词错一个——这样的文字稿读一遍、改一分钟就能用。俄语、日语、韩语上,即使是录音棚级的输入也会错掉约三分之一的词,因为能塞进浏览器的只有这个轻量模型。页面会在你花掉这次下载之前告诉你属于哪种情况,而不是之后。
为什么是 68 MB,而且没有服务器
所有“瞬间转写”的服务,都会把你的录音送到别人的机器上。采访、就诊记录、家人的语音——为了方便交出这些,代价太大。这里反过来:模型跑到文件这边。下载一次,之后断网也能用,录音也不会变成谁的训练数据。这个选择的代价就是那次下载,而且事先说清楚。
常见问题
我的录音会被上传吗?
不会。模型下载到你的浏览器并在那里运行。第一次之后,页面断网也能用。
为什么俄语的文字稿这么粗糙?
因为轻量模型在俄语上很弱:即使语音干净,也有约三分之一的词是错的。更强的模型存在,但重四倍,浏览器加载不了。页面会在任何下载之前提醒你。
可以生成字幕吗?
可以。除了纯文本,还会生成带时间轴的 SRT 文件。时间轴按三十秒一段,这正是模型真正知道的粒度。
能处理多长的录音?
最长一小时。更长的文件无法整块放进浏览器内存,请先切分。
相关工具
- 在线录音 一节课、一次采访、一个更想说出口而不是打字的念头。按下录音,看着电平跳动,停止后下载文件——中途什么都不会上传。
- 视频转 MP3 拖入一段视频,把声音带走。想放进手机的讲座、片段里的歌、需要转写的采访——画面被丢弃,声音被留下。
- 音频转换器 把曲子或录音放进来,选好格式,转换就在你自己的机器上完成——三分钟的文件只需几秒。什么都不上传,而这一点在这里比看上去更重要。
- 文字转语音 粘贴文本、选择语音、按下按钮。合成全部在浏览器里完成:系统语音立刻开口,神经网络语音需要一次性下载,但在任何设备上听起来都一样,还能存成文件。
- 在线记事本 一个在念头跑掉前把它记下的地方:一封回信草稿、一个电话号码、一张购物清单。文字随打随存,下次打开这个页面时还在原处。
- 字数统计 输入或粘贴文本,统计结果立即更新:词数、字符数、句子数、段落数以及预计阅读时间。
- Base64 编码解码 粘贴文本得到 Base64,粘贴 Base64 得回文本。中文、西里尔字母和表情都能完好通过——字符串按 UTF-8 读取,而不是按某一种语言的字节。
- 大小写转换 粘贴文本、选择样式、复制结果。同样的词有九种写法:四种日常写法,五种程序员常争论的写法。