由 OpenAI Whisper 驱动多语言稳健语音识别音频转文字工具

无限的音频和视频 转录

使用 OpenAI Whisper 在几秒内将语音转换成准确、易读的文字,支持常见音频与视频格式和多种导出格式。

100 种语言

自动检测口语语言

准确率因音频而异*

姓名、数字和术语需要校对

说话人标签

需另接说话人分离模型

无限生成

先免费使用,随时继续

* 实际准确率会随语言、录音质量、口音和背景噪声变化。 查看来源

登录后每天可免费转录 3 次,无需信用卡。

查看无限版价格

Whisper

多语言语音识别

时间戳

生成可用字幕片段

无限转录

不设固定转录时长额度

9 种导出

TXT、DOCX、PDF、SRT、VTT、CSV、Markdown、HTML、JSON

音频和视频

支持 29 种文件扩展名

私密安全

仅账号内处理

使用方法

三步把媒体文件变成可用文字

文件选择、处理进度、转录稿和下载内容都集中在私密工作台。

  1. 01

    登录账号

    创建私密工作台,把过去的转录记录保存在一起。

  2. 02

    上传音频或视频

    选择支持的文件:MP3、MP4、M4A、MOV、AAC、WAV、OGG、OPUS、MPEG、WMA、WMV、AVI、FLAC、AIFF、ALAC、3GP、MKV、WEBM、VOB、RMVB、MTS、TS、QuickTime、DivX。

  3. 03

    校对和导出

    检查名称和数字,再导出 TXT、DOCX、PDF、SRT、VTT、CSV、Markdown、HTML、JSON。

由 OpenAI Whisper 提供支持

识别 100 种口语语言

自动检测口语语言,将常见音频和视频中的语音转换成带时间信息的文字。

高准确度语音 AI

为真实对话设计,而不只是理想录音

自动语言识别和时间戳,让长录音更容易阅读和复用。

01

支持 100 种语言

自动检测口语语言,也可以在转录前手动选择。

多语言音频转文字

02

支持音频和视频

转录常见音频文件,也能提取视频音轨中的语音。

支持 29 种文件扩展名

03

带时间戳的片段

保留时间数据,方便生成字幕和定位长音视频内容。

SRT 和 VTT

多种导出格式

下载文字,也能直接导出字幕

可导出 Word、PDF、纯文本、字幕、表格、网页文件和结构化数据。免费版导出会带有简短的 ScribeZip 标记;无限版不会添加。

TXT

适合笔记和文档的纯文本

DOCX

可继续编辑的 Microsoft Word 文档

PDF

适合分享和打印的转录稿

SRT

带序号和时间戳的字幕

VTT

适合网页视频的时间字幕

CSV

适合表格处理的时间片段

MD

适合写作和发布的 Markdown

HTML

可直接打开的网页文档

JSON

结构化文字和片段数据

简单透明的定价

每天免费使用,需要更多时再升级

免费方案每天提供 3 次转录。升级无限方案后,个人可以不限次数转录,并获得不含 ScribeZip 标记的完整导出。

免费

US$0

每天免费使用,无需信用卡

  • 每天 3 次转录
  • 每次处理 1 个文件
  • 支持全部 29 种音频和视频格式
  • 9 种导出格式,带有简短 ScribeZip 标记
节省 50%

无限 · 年付

US$10/ 月

每年收取 US$120 · 节省 50%

  • 单人无限转录
  • 每次处理 1 个文件
  • 支持全部 29 种音频和视频格式
  • 9 种导出格式,不含 ScribeZip 标记
  • 私密保存账号内的转录记录

无限 · 月付

US$20/ 月

按月收取 · 可随时取消

  • 单人无限转录
  • 每次处理 1 个文件
  • 支持全部 29 种音频和视频格式
  • 9 种导出格式,不含 ScribeZip 标记
  • 私密保存账号内的转录记录

由 Stripe 提供安全结账

付款信息由 Stripe Checkout 处理,ScribeZip 不会存储你的银行卡信息。

Stripe 托管付款美元账单清晰透明账号内管理订阅

无限套餐仅限个人正常使用,并受公平使用和防滥用规则约束。

01登录账号
02私密上传
03AI 语音转录
04账号内结果

默认保护隐私

媒体文件只在你的账号内处理

上传必须在登录后的工作台中进行,文件不会被发布成公开媒体页面。

  • 登录后才会真正开始上传文件
  • 处理期间使用私密文件存储
  • 源媒体默认在处理结束后删除
  • 只有你的账号可以查看转录历史

来源与说明

哪些资料支持 ScribeZip 的转录说明?

ScribeZip 使用 OpenAI Whisper 进行语音识别。OpenAI 公开资料说明了 Whisper 的多语言转录、语言识别、时间戳,以及对口音和背景噪声的稳健性。可选语言以 Whisper 的公开语言列表为准;实际准确率仍会因音频而异。

音频转文字常见问题

怎样把音频转成文字?

点击转录区域,需要时先登录,再在工作台上传支持的文件并开始转录。导出前可以先检查文字。

ScribeZip 支持多少种语言?

ScribeZip 支持 100 种口语语言转录,可以自动识别,也可以在处理前手动选择。

Whisper 可以识别多个说话人吗?

Whisper 可以转录语音,但不会添加说话人标签。如需区分不同说话人,需要另外接入说话人分离模型。

可以上传哪些格式?

支持 MP3、MP4、M4A、MOV、AAC、WAV、OGG、OPUS、MPEG、WMA、WMV、AVI、FLAC、AIFF、ALAC、3GP、MKV、WEBM、VOB、RMVB、MTS、TS、QuickTime、DivX。文件大小以上传工作台显示的限制为准。

免费方案包含什么?

登录用户每天可以免费转录 3 次。免费导出文件的开头和结尾会有简短的 ScribeZip 标记;升级无限版后不会添加。

会识别视频画面中的内容吗?

不会。ScribeZip 转录视频音轨中的语音,不会读取静音画面或屏幕文字。

把下一段录音变成文字

今天可以免费转录 3 次。