实时语音转文字
它听着,它打字,而声音不出这个房间
…
- 1
选它听什么,以及听哪种语言
麦克风,或者另一个标签页。麦克风听的是房间,戴着耳机时那就是你这一半对话;要听到其他人得选标签页,浏览器会问你选哪一个。然后告诉它接下来说的是哪种语言,因为它不会猜。
- 2
说话
你说的字会陆续出现,最后一行会不断改写自己直到这句话说完,实时字幕就是这个样子。一段声音用完之后,它对应的文字就不再变动,并入上面的文字稿。
- 3
把文字稿拿走
复制,或者下载成纯文本。全程没有录音也没有存储,所以关掉这个页面就什么都不剩了。
FAQ
- 我的声音会被上传吗?
- 不会,而且这是站上唯一一个能这么说的转录工具。另外两个会把声音发到服务器,它们的页面也直说了。这一个在你第一次点开始时下载一份语音模型,大约 196 MB,之后所有事情都在你自己的机器上发生。没有任何请求携带音频,这一点你可以自己验证:打开网络面板,一边说一边看。
- 它在录我吗?
- 没有。存在的只有最近这几秒的声音,放在内存里供模型读取,以及页面上的文字。两样都不会写进磁盘,事后也没有什么需要删除。
- 它能听到会议里其他人说话吗?
- 只有当他们的声音传到你的麦克风,或者会议开在浏览器标签页里的时候。选标签页那个选项,浏览器会问你共享哪一个,连同它的声音。它够不到浏览器以外的程序,所以用 Zoom 或 Teams 桌面客户端打的电话拿不到。把同一个会议开在标签页里就可以。
- 到底有多快?
- 比说话快,而这里只有这一个速度是要紧的。在这个版本上实测:十一秒的语音,有显卡的机器不到一秒返回,没有显卡的五秒返回。两个都快过语音本身,所以它不会越落越远。
- 为什么最后一行一直在变?
- 因为那是对一句还没说完的话的猜测。模型读的是一整段声音而不是一个一个词,所以这段声音越完整,它就越会修正之前的判断。最后一行以上的内容都是定了的:那些声音已经用过并且放下了。
- 为什么一定要我选语言?
- 因为它不会猜,而且它猜错的方式和你预期的不一样。不给语言时它默认按英语处理,而英语提示词对上中文语音,出来的不是乱码,是翻译:你用中文说,屏幕上出现英文。那已经是另一个工具了,所以它宁可问你。这个列表默认停在这个页面所用的语言上。
- 能识别哪些语言?
- 模型认识大约九十九种,列表里放了最常被要的十六种。如果没有你要的那种,那是一行代码的事而不是能力问题,说一声就行。