简介与亮点
语幕是一款桌面视频字幕工具:把任意语种的视频 / 音频,自动识别、翻译、生成通顺的中文字幕。针对困难声学场景(低语、急促对白、多人混杂、情绪化台词)与领域用词做了全流程深度调优。
不止识别一环,而是从 语音检测 → 识别 → 后处理 → 翻译 每一步都打磨,这是语幕区别于通用转字幕工具的核心优势:
- 语音检测(VAD):对低语、气声、极低人声做敏感召回,少漏话
- 语音识别(ASR):困难声学场景(高情绪、急促低语、多人混杂)鲁棒,领域用词 / 人名一致性好
- 后处理:宽松过滤策略,保留真实对白,不把语气词当噪音误删
- 翻译:译前全量分析(人物表 / 用词纠错 / 剧情上下文)+ 领域术语,译文自然、信达雅
- 说话人分离(可选):多人同屏按性别上色(男蓝女粉),先说的在上
一 安装
语幕提供两种形态,任选其一:
| 形态 | 怎么用 | 适合 |
|---|---|---|
| 绿色版(免安装) | 解压后进入 Yumu_v2.1.4/ 文件夹,双击 语幕.exe 即用 | 随手用、放 U 盘 / 移动硬盘 |
| 安装版 | 双击 语幕_setup_<版本>.exe,按提示安装,从开始菜单 / 桌面启动 | 想要快捷方式、正式安装 |
本地模式硬件要求
- 系统:Windows 10 / 11 64 位
- 显卡:NVIDIA 显卡,最低 6 GB 显存(4 GB 极限档也能跑小模型),推荐 ≥ 12 GB
- 无独显 / CPU 也能跑:小模型(Parakeet 英欧 ASR int8、FunASR 等)支持纯 CPU,只是慢一些
- 内存:最低 16 GB,推荐 32 GB+;硬盘:程序约 6 GB,模型按需下载,建议预留 20 GB + SSD
二 激活
- 启动语幕,点击左下角「激活」图标(指纹按钮)
- 在弹出窗口粘贴卖家提供的激活码
- 点击「激活」,提示「激活成功」即可
Q- 次数卡 / M- 月卡 / Y- 年卡 / P- 永久版。激活类型
| 类型 | 有效范围 | 用完 / 到期后 |
|---|---|---|
| 次数卡 | 满功能 N 次,不限时长;一个视频完整跑完出字幕 = 1 次(中途取消 / 失败不计次) | 次数用完 → 回落试用模式 |
| 月卡 / 年卡 | 有效期内不限次数、不限时长 | 到期 → 降级回试用 |
| 永久版 | 一次买断,永久全功能 + 后续更新 | — |
次数卡可叠加:再买一张次数累加(如 3 + 3 = 6 次),激活页会显示剩余次数。适合"先试真本事"或偶尔用几次。
三 下载模型(最容易卡在这一步)
语幕的小模型已内置、开箱即用;但识别(ASR)和翻译大模型第一次用到时需要下载(每个约 1~7 GB)。这一节看完就通。
方式一:软件内自动下载(推荐)
- 左侧栏点 ☁️ 模型管理
- 找到要用的模型 → 点右侧「下载」,进度条走完变「已安装」
- 也可以不管它直接「开始处理」,用到的模型会自动开始下载
下载源自动走 ModelScope / HF-Mirror 国内镜像(无需梯子),支持断点续传和失败自动重试;自动下载到 C:\Users\你的用户名\.jav2ch\models\(自动管理)。
方式二:自动失败 → 夸克网盘手动下载(兜底)
- 网络不稳导致自动下载失败时,会自动弹出「手动下载」窗口。点窗口里的夸克网盘链接下载对应模型文件
- 回到「手动下载」窗口,点「选择已下载的文件」,选中刚下好的那个文件
该下哪个模型?(按语言)
| 你的视频 | 识别模型 | 翻译模型 |
|---|---|---|
| 日语(主打) | Qwen3-ASR(日语精度最高) | Hy-MT2 |
| 中文 / 韩语 / 其它亚洲语言 | Qwen3-ASR(同引擎直通) | Hy-MT2 |
| 英语 / 欧洲语言 | Parakeet v3(欧洲 25 语专精,纯 CPU 也快) | Hy-MT2 |
| 阿拉伯语 / 多语混合 | Whisper large-v3-turbo | Hy-MT2 |
拿不准就点「一键适配显卡」,它会按你的显存自动选好识别 + 翻译模型。
四 界面总览
首次启动会弹出新手引导(3 页,只弹一次)。顶部有 5 个功能 Tab,覆盖字幕全流程:
| Tab | 作用 |
|---|---|
| 🎬 视频 → 字幕 | 一站式:转录 + 翻译 +(可选)压制,最常用 |
| 🎤 语音转文字 | 只出原文字幕(不翻译) |
| 📝 字幕翻译 | 把已有字幕文件译成中文 / 双语 |
| ✏️ 字幕编辑 | 双语 ASS 双列对照,手动校对 |
| 🎞️ 字幕压制 | 把字幕烧进视频(硬字幕) |
左侧栏:🏠 主页 / 📄 日志 / ☁️ 模型管理 / 👆 激活 / ⚙️ 设置。
五 功能详解
5.1 视频 → 字幕(主流程)
- 把视频 / 音频拖到首页,或点「选择文件 / 选择文件夹」(支持 MP4 / MKV / AVI / WAV / FLAC 等)
- 设 视频语言(源)→ 字幕输出(目标),选 内容类型(影视·剧集 / 综艺 / 课程·访谈 / ASMR·音声)
- (建议)先点右上角「一键适配显卡」,自动按显存选最优配置
- 点「开始处理」,进度条按阶段显示,完成后给出各阶段耗时
视频输出决定要不要顺手出成品视频:内嵌字幕·快(默认,字幕封装进 mkv,秒出,播放器可开关)/ 烧录字幕·慢(字幕烧进画面,重编码,拿去剪辑 / 传平台字体永不错乱)/ 不生成视频(只要字幕文件)。
☁ 云端(无显卡) — 识别(
qwen3-asr-flash)+ 翻译(DeepSeek-V4-Flash)走云端,不吃显卡,再破的电脑也能几分钟出片。切到「云端」→ 粘贴云端算力密钥 → 验证看余额 → 拖视频开始。按量付费,软件里实时显示余额与本次消耗。处理流程(进度条按此顺序,每阶段完成显示耗时):音频提取 →(可选)人声分离 → 预处理(音量归一)→ 语音检测(VAD)→(可选)说话人分离 → 分段 → 语音识别 → 后处理(去重 / 断句 / 过滤)→ 翻译 →(可选)内嵌 / 烧录出成品。中途可停、可续。
输出文件(位于 输出目录/<视频名>/):sub_zh.ass 中文字幕、sub_zh.srt(可选)、双语 ASS(可选)、成品视频 mkv(选内嵌 / 烧录时)。
5.2 语音转文字
只做识别、输出原文字幕(不翻译),用于只要听写稿的场景。识别模型下拉会标注每个模型所需显存与精度。
5.3 字幕翻译
上传已有字幕(.ass / .srt / .vtt),翻译成目标语言。输出可选双语(译文 + 原文)或单语。翻译模型:Hy-MT2 本地 / 云端算力 / OpenAI 兼容 API。
5.4 字幕编辑
打开字幕逐行校对,双语 ASS 两列对照。支持:双语编辑 · 拆分 / 合并行 · 时间平移 · 重翻译选中行 · 关联视频播放 · 12 种内置样式。
5.5 字幕压制
选视频 + 字幕,输出带字幕的视频,默认 NVENC 硬件加速。三种模式:烧录(硬字幕,任何播放器都能看,发布首选)/ 内嵌(软字幕,封进 MKV 不重编码,可开关)/ 仅复制字幕。
六 参数说明
6.1 预设场景(一选即调好一整套)
| 预设 | 说明 | 显存 |
|---|---|---|
| 通用模式(默认) | 默认配置,速度优先,说话人分离关 | 12 GB |
| 精校模式(高质量) | 最佳质量组合(1.7B ASR + 7B 翻译 + 说话人分离开) | ≥ 12 GB |
| 快速模式(低显存 / 草稿) | 小模型 + 关 pre-analysis,省显存提速 | 8 GB |
| ASMR 模式 | 耳语 / 极低声优化(敏感 VAD) | 10 GB |
| 动漫模式 | BGM 强场景优化(人声分离) | 12 GB |
6.2 字幕样式编辑器
点「样式编辑器…」打开,上方 12 个预设卡片(经典白字 / 黑底白字 / B站弹幕风 / 双语主中文 / Netflix极简 / 综艺花字黄 / 经典黄字 / 蓝调描边 / 电影感衬线 等),选一个再微调,实时预览。可调:字体 / 主字号 / 副字号 / 主色 / 描边色 / 描边粗细 / 副字体 / 副色。双语字幕每屏 = 译文(大字)+ 原文(小字),超长句自动拆到多屏。
6.3 高级设置(手动指定模型)
默认所有模型走「自动」(按 语言 × 显存 智能路由)。打开「高级设置」可手动覆盖:ASR 模型、VAD 后端、音频源、翻译后端 / 模型等。
各识别模型简介:
- Qwen3-ASR 1.7B ★:日 / 中 / 韩 / 泰 / 越等亚洲语言高精度(日语 Fleurs WER 5.20%,业界最高),困难场景鲁棒,字级时间戳;需 ~11 GB
- Qwen3-ASR 0.6B:1.7B 轻量版,语言覆盖相同,8~10 GB 自动选用
- Parakeet-TDT 0.6B v3:英 + 欧洲 25 语专精(GPU 5.6 GB / CPU int8 ~12x 实时),英语 Fleurs 4.85%
- Kotoba v2.0-faster:日语专精,仅需 4 GB,快
- Whisper large-v3-turbo:多语言通用,快;非专精语言 / 低显存兜底
- SenseVoice Small:< 2 GB 纯 CPU 兜底,多语言
- Anime-Whisper:动漫 / 音声拟声(气声、环境声)专精(对白仍推荐 Qwen3)
翻译后端:Hy-MT2-7B 本地 ★(腾讯混元翻译 2 代,33 语,信达雅、重复幻觉少)/ Hy-MT2-1.8B(低显存)/ OpenAI 兼容 API / ☁ 云端算力(默认 DeepSeek-V4-Flash,无需自备 Key)。译前还会做全量分析(人物表 / ASR 纠错 / 剧情摘要)注入翻译。
七 推荐配置速查
| 显存 | 日语 ASR | 中 / 韩 ASR | 英 / 欧 ASR | 翻译 |
|---|---|---|---|---|
| ☁ 无显卡 / 嫌慢 | 云端 qwen3-asr-flash | 云端 DeepSeek | ||
| 12 GB(默认) | Qwen3-ASR 1.7B | Qwen3-ASR 1.7B | Parakeet | Hy-MT2-7B |
| 10 GB | Qwen3-ASR 0.6B | Qwen3-ASR 0.6B | Parakeet | Hy-MT2-7B / 1.8B |
| 8 GB | Qwen3-ASR 0.6B | Qwen3-ASR 0.6B | Parakeet | Hy-MT2-1.8B |
| 6 GB | Kotoba v2.0 | Whisper turbo | Whisper turbo | Hy-MT2-1.8B |
| 纯 CPU / 无卡 | ☁ 建议云端 | Parakeet int8(CPU 也快) | ☁ 云端 / 1.8B | |
八 常见问题
处理很慢 / 卡在某阶段
音频提取与人声分离(Demucs)较慢属正常;不需要人声分离时在高级设置里关掉能省很多时间。识别 / 翻译走 GPU,确认没有别的程序占用显卡。
显存不足 / CUDA out of memory
点「一键适配显卡」自动降档;或手动换更小 ASR(1.7B→0.6B)、关 pre-analysis、调小 batch、关人声分离。
第一次用,一直在下载模型
识别和翻译大模型第一次用到时要联网下(每个 1~7 GB),这是正常的。建议开始处理前先在「模型管理」把要用的模型下好。小模型已内置无需下载。
模型下载很慢 / 失败
默认走国内镜像(无需梯子),可在「模型管理」重试,支持断点续传。实在下不动 → 用夸克网盘手动下载兜底:下好文件后点「选择已下载的文件」,软件自动归位,不用自己放目录。
生成的 mkv 打不开 / 黑屏
多半是源视频是 AV1 编码,「内嵌」模式不改视频流,老播放器不支持 AV1 就放不出来。办法:① 换支持 AV1 的播放器(新版 PotPlayer / VLC / mpv);② 「视频输出」选烧录(重编码为 H.264,任何设备都能放)。
内嵌和烧录选哪个?
自己在电脑上看 → 内嵌(秒出、无损、可开关字幕);要拿去剪辑或上传平台 → 烧录(字幕烧进画面,任何设备 / 平台字体永不错乱)。
激活失败
确认联网(无需梯子);检查激活码大小写 / 横线 / 空格;一码一机,换机需联系卖家解绑;杀软 / 防火墙可能拦截,临时关闭再试。
软件无法启动 / 双击没反应
确认 NVIDIA 显卡 + 较新驱动;确认 _internal 文件夹完整未被杀毒删除;路径尽量英文;试管理员权限运行。
售后联系
购买后添加,方便售后与更新通知:
- 微信:
yooooloooov8 - QQ:
3091184072 - 交流 / 求助 QQ 群:
1075669841(问题群里互助、更新通知,推荐加)