每个音频流的长度都有时间限制 - 这是 Google 服务器的限制,似乎在 60 秒左右,尽管没有记录。
这个限制是完全合理的——你不能指望谷歌处理数小时的音频,因为该模型永远无法扩展。您应该以类似于 Siri 的方式对待该服务 - 启动识别会话,向其提供短音频流,处理这些结果,启动新会话。
不幸的是,由于网络语音识别工作仍在积极开发中,事情仍然非常流畅,文档也很有限。我建议在 Chrome 浏览器邮件列表上挖掘并在那里发布特定问题。我发现在 Google 从事此工作的人对特定问题非常敏感。
有关语音识别的最小演示以及对当前语音 API 问题的一些想法,您可能想查看有关 Web 语音识别的教程
| 归档时间: |
|
| 查看次数: |
1949 次 |
| 最近记录: |