本机运行 · 免费

实时语音转文字

它听着,它打字,而声音不出这个房间

和 Otter.ai Pro 的详细对比和 Descript 的详细对比

  1. 1

    选它听什么,以及听哪种语言

    麦克风,或者另一个标签页。麦克风听的是房间,戴着耳机时那就是你这一半对话;要听到其他人得选标签页,浏览器会问你选哪一个。然后告诉它接下来说的是哪种语言,因为它不会猜。

  2. 2

    说话

    你说的字会陆续出现,最后一行会不断改写自己直到这句话说完,实时字幕就是这个样子。一段声音用完之后,它对应的文字就不再变动,并入上面的文字稿。

  3. 3

    把文字稿拿走

    复制,或者下载成纯文本。全程没有录音也没有存储,所以关掉这个页面就什么都不剩了。

FAQ

我的声音会被上传吗?
不会,而且这是站上唯一一个能这么说的转录工具。另外两个会把声音发到服务器,它们的页面也直说了。这一个在你第一次点开始时下载一份语音模型,大约 196 MB,之后所有事情都在你自己的机器上发生。没有任何请求携带音频,这一点你可以自己验证:打开网络面板,一边说一边看。
它在录我吗?
没有。存在的只有最近这几秒的声音,放在内存里供模型读取,以及页面上的文字。两样都不会写进磁盘,事后也没有什么需要删除。
它能听到会议里其他人说话吗?
只有当他们的声音传到你的麦克风,或者会议开在浏览器标签页里的时候。选标签页那个选项,浏览器会问你共享哪一个,连同它的声音。它够不到浏览器以外的程序,所以用 Zoom 或 Teams 桌面客户端打的电话拿不到。把同一个会议开在标签页里就可以。
到底有多快?
比说话快,而这里只有这一个速度是要紧的。在这个版本上实测:十一秒的语音,有显卡的机器不到一秒返回,没有显卡的五秒返回。两个都快过语音本身,所以它不会越落越远。
为什么最后一行一直在变?
因为那是对一句还没说完的话的猜测。模型读的是一整段声音而不是一个一个词,所以这段声音越完整,它就越会修正之前的判断。最后一行以上的内容都是定了的:那些声音已经用过并且放下了。
为什么一定要我选语言?
因为它不会猜,而且它猜错的方式和你预期的不一样。不给语言时它默认按英语处理,而英语提示词对上中文语音,出来的不是乱码,是翻译:你用中文说,屏幕上出现英文。那已经是另一个工具了,所以它宁可问你。这个列表默认停在这个页面所用的语言上。
能识别哪些语言?
模型认识大约九十九种,列表里放了最常被要的十六种。如果没有你要的那种,那是一行代码的事而不是能力问题,说一声就行。

更多同类工具