
上传录音自动转写,无需逐字手动输入
上传最大 250 MB 的 MP3、WAV、M4A、FLAC、OGG、AAC 或纯音频 WEBM 文件,也可以选择 AIMusicGen 歌曲库中的可播放歌曲。将访谈、会议录音、课程和语音备忘转成文字,方便后续核对与使用。
试用 AI 语音转文字音频录音文字稿使用 AIMusicGen AI 语音转文字工具,在线将音频转成文本。支持多语言语音识别、区分说话人、添加时间戳和下载文字稿,让录音内容更方便用于笔记整理、字幕制作与内容创作。

上传最大 250 MB 的 MP3、WAV、M4A、FLAC、OGG、AAC 或纯音频 WEBM 文件,也可以选择 AIMusicGen 歌曲库中的可播放歌曲。将访谈、会议录音、课程和语音备忘转成文字,方便后续核对与使用。
试用 AI 语音转文字音频录音文字稿
让 AI 自动识别语音语言,或手动选择英语、普通话、西班牙语、日语、阿拉伯语等支持的语言。为访谈和多人对话开启说话人识别,可自动判断人数,也可手动指定 2–6 位说话人。
试用 AI 语音转文字语音对话带说话人标签的文本
选择按词或按字符生成时间戳,帮助定位录音中的相关内容。开启声音事件标注,可在文字稿中记录笑声、掌声或背景音乐等声音信息,让音频转文字的结果保留更多现场语境。
试用 AI 语音转文字语音与环境声音带时间戳的片段
查看完整文字稿和分段结果,直接复制文本,或下载包含可用时间戳和说话人标签的 TXT 文件。在历史记录中回看已保存的结果,再使用熟悉的编辑工具整理会议笔记、播客节目笔记、文章或字幕。
试用 AI 语音转文字音频转写结果可复用文本使用 AIMusicGen AI 语音转文字工具,在线将音频转成文本。支持多语言语音识别、区分说话人、添加时间戳和下载文字稿,让录音内容更方便用于笔记整理、字幕制作与内容创作。
试用 AI 语音转文字添加最大 250 MB 的受支持音频文件,或选择 AIMusicGen 歌曲库中的可播放歌曲。尽量使用人声清晰、背景噪音较少的录音,以获得更好的语音转文字结果。
展开「更多设置」,选择录音语言或使用自动识别。多人对话可开启「区分说话人」,并选择时间戳精度、是否标注声音事件。如果不同说话人已分别录在独立声道中,可使用「分离音频声道」替代说话人识别。
The first idea was to keep the arrangement intimate.
Then the chorus opened up and changed the whole direction.
查看页面显示的预估积分,点击「开始转写」。完成后查看完整文本和带时间戳的片段,复制文字稿或下载 TXT,再用熟悉的编辑工具核对人名、专业术语后发布或分享。
在 Aimusicgen 中继续制作配音、生成音效、编辑人声、分离音轨或创作音乐视频。
了解 AI 语音转文字的免费积分、音频格式、说话人识别、时间戳、TXT 下载与数据处理方式。
AI 语音转文字通过自动语音识别技术,将录音中的语音转换成书面文本。AIMusicGen 音频转文字工具支持转写录音、区分说话人和添加时间戳,帮助你整理口述内容,无需逐字手动输入。
你可以转写会议、访谈、播客、讲座、培训课程、语音备忘和其他以说话为主的录音。文字稿可作为会议纪要、研究笔记、节目笔记、文章或字幕的初稿。当前页面处理上传的音频和已保存的歌曲,不提供实时对话录音功能。
可以。AIMusicGen 提供免费积分,只要余额足以支付当前任务,就可以用于试用语音转文字。所需积分按音频时长计算,提交前页面会显示预估用量。免费积分不代表无限转写,请以当前余额和页面显示的费用为准。
支持 MP3、WAV、M4A、FLAC、OGG、AAC 和纯音频 WEBM 格式,单个文件最大 250 MB。当前不支持直接上传视频,请先从视频中提取音频,再以受支持的格式上传。较大的录音可以先拆分成多个较小文件,再分别转写。
你可以使用自动语言识别,也可以手动选择英语、普通话、西班牙语、印地语、阿拉伯语、葡萄牙语、俄语、日语、法语、德语、韩语、意大利语或荷兰语。语音转文字会转写录音中实际说出的内容;语言选项用于辅助识别,不会将文字稿翻译成所选语言。
可以。开启「区分说话人」,为访谈、会议和多人对话中的不同声音添加标签。可由 AI 自动判断人数,也可以手动指定 2–6 位说话人。如果参与者已经分别录在独立声道中,可改用「分离音频声道」。这两个设置不能同时开启;出现多人同时说话时,建议核对标签是否正确。
可以。你可以选择按词或按字符生成时间戳,也可以关闭时间戳。结果页会将识别内容组织成便于阅读的片段,下载的 TXT 会包含可用的时间信息和说话人标签。你可以用这些内容在字幕编辑器中制作字幕;当前不直接提供 SRT 或 VTT 下载。
可以。开启「标注声音事件」,可请求识别笑声、掌声或背景音乐等声音信息,为文字稿补充上下文。该功能不会分离音轨或生成音效,也不保证能识别录音中的每一种声音。
准确性会受到录音清晰度、语言、口音、麦克风质量和背景噪音的影响。人声清楚、说话重叠较少的录音通常效果更好。在使用或发布文字稿前,建议对照原音频核对人名、数字、专业术语、标点和说话人标签。
处理时间取决于录音时长、文件大小、上传速度和当前服务负载。较短且清晰的录音通常比长录音处理更快。转写期间请保持页面打开;不同录音的完成时间会有所差异。
你可以预览并复制文字稿,或下载 TXT 后,在熟悉的文本编辑器中修改人名、措辞和格式。当前暂不支持在页面内直接编辑文本。如需重新转写,可调整语言或其他设置后再次提交音频;每次新转写都会消耗积分。
音频会被发送至转写服务进行处理,已保存的转写结果可以在账户历史记录中回看。历史记录不等同于上传源音频的备份,请自行保留原文件,并下载重要文字稿。上传机密或敏感录音前,请查阅当前隐私政策和数据处理条款。