首页/工具/音视频/音视频转文字

音视频转文字

拖入音视频就得到逐段文稿,导出 Word / txt,全程离线不联网

音视频文件只在你的浏览器里处理,不会上传到服务器;不需要注册。

这个工具能做什么

把音频或视频里的人声识别成文字,可以输出纯文字或带时间码的逐句文本,并导出 Word 与纯文本两种格式。识别使用内置的离线语音模型,首次使用需要先解压加载模型,因此第一次等待时间比后续长;音视频不会上传到服务器。

如何使用

  1. 添加一个或多个音视频文件
  2. 选择语言:说中文的内容选「中文」最准
  3. 选择输出内容:只要文字,或文字加时间码
  4. 勾选导出格式(Word / 纯文本)
  5. 点「开始识别」,完成后下载结果

适合哪些场景

  • 把访谈录音整理成文字稿
  • 给视频生成带时间码的字幕文本
  • 把会议录音转成可以检索的笔记

使用限制

  • 首次加载离线模型需要一定时间,之后再次使用会明显更快。
  • 长音频会按静音切段逐段识别,耗时随音频长度增加。
  • 识别准确率受音质、口音与背景噪声影响,专业名词可能需要人工校对。
  • 「自动检测」对短音频不够稳定,已知语言时建议手动选择。

常见问题

识别需要联网吗?
不需要。模型已经内置在页面里,识别全程在本机运行。
为什么第一次等待很久?
首次使用需要解压并加载离线语音模型,之后就快了。
时间码有什么用?
可以对照原音视频定位每一句出现的位置,方便做字幕。
准确率如何?
安静环境下的普通话录音效果较好;口音重、噪声大或专业术语多时建议人工校对。

相关工具

隐私说明

音视频文件只在你的浏览器里处理,不会上传到服务器;不需要注册。

xxoobaby · 全部工具在浏览器本地运行,数据不上传。 MIT License.