把视频里的口播
变成可编辑的文案
粘贴链接或整段分享口令,自动取音轨、识别语音、按句分段输出。
带时间码,可复制、可导出 TXT 与 SRT 字幕。
口播、教学、知识分享这类视频通吃;电影、剧集、长直播不处理——音轨太长既慢又没意义。
语音识别要调用第三方大模型、按量计费,所以这里有两种用法:直接用本站的公共额度(什么都不用填,但有人均限额), 或者填你自己的 API Key(额度算你的,本站不接触你的密钥)。
没填过的话,去 硅基流动 注册并实名,生成一个 Key(FunAudioLLM/SenseVoiceSmall 模型目前免费)。 Key 只保存在你这台设备的浏览器里,提交任务时随请求一起发给服务端用于本次识别, 服务端不落盘、不写日志;换台设备或清了浏览器数据就需要重新填。
没能完成提取
四步拿到完整文案
不需要安装软件,不需要登录任何平台账号。语音识别默认走站点服务,也能换成你自己的 Key。
复制分享链接
在 App 里点「分享 → 复制链接」,把整段口令粘贴到输入框即可。抖音、快手、B站 的短链和长链都认。
选择识别方式
默认用站点自带的识别服务,什么都不用填;想用自己的额度,就在「语音识别设置」里换成自己的 Key。
服务端自动处理
识别平台后按各家接口取作品信息,能取纯音轨就只下音轨,再抽离、切片、提交转写。
拿走你的文案
按句分段、带时间码展示。可一键复制,也能导出 TXT 文本或 SRT 字幕文件。
为「拿文案」这件事设计的细节
中文识别准确
采用 SenseVoice 中文语音模型,对口播、带货话术、知识分享这类内容识别稳定,自带标点。
带时间码分段
按句切分并标注起止时间,方便对照原片定位,也方便直接做剪辑脚本和字幕。
多格式导出
纯文本、带时间码文本、SRT 字幕三种视图随意切换,复制或下载都只要一次点击。
多平台通用
抖音、快手、哔哩哔哩走本站自己的解析,其余站点由通用引擎兜底;能取到纯音轨时只下音轨,省流量也更快。
轻量免安装
网页即用,手机电脑都适配。任务在云端排队执行,关掉页面也不影响已跑完的历史记录。
常见问题
语音识别的额度算谁的?
自己的 Key 要填什么?
支持哪些平台和链接形式?
- 抖音 —— App 分享出来的整段口令(形如「7.68 复制打开抖音…https://v.douyin.com/xxxx/」)、短链 v.douyin.com、网页端 douyin.com/video/数字
- 快手 —— App 分享的短链 v.kuaishou.com/xxxxxx;网页版 www.kuaishou.com/short-video/… 这种短 ID 解析不了,请改用 App 分享
- 哔哩哔哩 —— bilibili.com/video/BV… 或 av…、短链 b23.tv/xxxx;多分 P 视频只取第一个分 P(可自己在链接后加 ?p=N 指定)
直接粘贴整段分享文字即可,程序会自动识别其中的链接。