音视频转文字
拖入音视频就得到逐段文稿,导出 Word / txt,全程离线不联网
音视频文件只在你的浏览器里处理,不会上传到服务器;不需要注册。
这个工具能做什么
把音频或视频里的人声识别成文字,可以输出纯文字或带时间码的逐句文本,并导出 Word 与纯文本两种格式。识别使用内置的离线语音模型,首次使用需要先解压加载模型,因此第一次等待时间比后续长;音视频不会上传到服务器。
如何使用
- 添加一个或多个音视频文件
- 选择语言:说中文的内容选「中文」最准
- 选择输出内容:只要文字,或文字加时间码
- 勾选导出格式(Word / 纯文本)
- 点「开始识别」,完成后下载结果
适合哪些场景
- 把访谈录音整理成文字稿
- 给视频生成带时间码的字幕文本
- 把会议录音转成可以检索的笔记
使用限制
- 首次加载离线模型需要一定时间,之后再次使用会明显更快。
- 长音频会按静音切段逐段识别,耗时随音频长度增加。
- 识别准确率受音质、口音与背景噪声影响,专业名词可能需要人工校对。
- 「自动检测」对短音频不够稳定,已知语言时建议手动选择。
常见问题
- 识别需要联网吗?
- 不需要。模型已经内置在页面里,识别全程在本机运行。
- 为什么第一次等待很久?
- 首次使用需要解压并加载离线语音模型,之后就快了。
- 时间码有什么用?
- 可以对照原音视频定位每一句出现的位置,方便做字幕。
- 准确率如何?
- 安静环境下的普通话录音效果较好;口音重、噪声大或专业术语多时建议人工校对。
相关工具
隐私说明
音视频文件只在你的浏览器里处理,不会上传到服务器;不需要注册。
xxoobaby · 全部工具在浏览器本地运行,数据不上传。 MIT License.