Typeless 衡量 ASR 效果的指标,不是传统的 WER 等指标,而是“零编辑率”。也就是说,如果用户说了一段话,没有经过任何编辑就直接发出去,这样的输入占整体输入中的比例。他们会想尽一切办法去提高这个指标,而无需识别一字一句的纠错。在语音输入场景下,这个指标选择得实在太好太好了。
Typeless 持续优化达到了惊人的长程稳定性,录一个 9 分钟的音频然后直接转写,几乎不用修改。
它能做到这么好,还因为有一个很好的反馈循环:它会识别输入框在最后发出来的文本和它自己识别的文本之间做 diff,所有差异的地方都会成为它进行反馈迭代的非常好的信号。
而且它现在还能识别输入框既有的文字。比如你输入框里已经打了一些字,然后再去用语音输入,它可以基于前面的文字做续写,所有的格式和内容全部都是一致的。
并且 Typeless 现在的改写也很牛逼。比如有一个很难的地方,它分不清“男他”和“女她”。比如我写一段三四百字的面评,里面的候选人是女的,但它一开始识别成了“他”。我全选后用另外一个改写功能,说“把‘他’改成‘她’”,它就可以一键把这几百字里面所有的“他”全部改成“她”。