作为我正在研究的概念证明的一部分,我需要自动转录一些简短的MP3.我目前正在研究云解决方案或Web API服务,将MP3作为简单的HTTP请求发送并接收转录.
我在这里找到的唯一免费/开源解决方案,但演示似乎不起作用(至少不是我需要转录的文件).我已经为呼叫中心找到了一些企业解决方案,但到目前为止我无法简单地集成到一个项目中.
是否有基于网络的语音识别服务?一个能够滤除小噪音的人将是一个加号.
我正在研究Chrome浏览器.代码
<input x-webkit-speech>将显示:

如果单击麦克风图标,则可以输入语音.像这样

我的问题是如何让它录制语音自动识别,而无需手动点击麦克风图标?
如页面加载时,就开始记录; 或编写代码来模拟点击事件?可能吗?
您可以提供示例代码或x-webkit-speech API的文档吗?
谢谢.