🎬 语幕 Yumu · 使用说明书

语幕 使用说明书

多语视频自动生成中文字幕 · 23 种语言 · 云端模式(无需显卡)· 一键烧录。本手册覆盖安装、激活、模型下载、五大功能与常见问题。

v2.1.4 · 2026-07

简介与亮点

语幕是一款桌面视频字幕工具:把任意语种的视频 / 音频,自动识别、翻译、生成通顺的中文字幕。针对困难声学场景(低语、急促对白、多人混杂、情绪化台词)与领域用词做了全流程深度调优。

不止识别一环,而是从 语音检测 → 识别 → 后处理 → 翻译 每一步都打磨,这是语幕区别于通用转字幕工具的核心优势:

  • 语音检测(VAD):对低语、气声、极低人声做敏感召回,少漏话
  • 语音识别(ASR):困难声学场景(高情绪、急促低语、多人混杂)鲁棒,领域用词 / 人名一致性好
  • 后处理:宽松过滤策略,保留真实对白,不把语气词当噪音误删
  • 翻译:译前全量分析(人物表 / 用词纠错 / 剧情上下文)+ 领域术语,译文自然、信达雅
  • 说话人分离(可选):多人同屏按性别上色(男蓝女粉),先说的在上

安装

语幕提供两种形态,任选其一:

形态怎么用适合
绿色版(免安装)解压后进入 Yumu_v2.1.4/ 文件夹,双击 语幕.exe 即用随手用、放 U 盘 / 移动硬盘
安装版双击 语幕_setup_<版本>.exe,按提示安装,从开始菜单 / 桌面启动想要快捷方式、正式安装
☁ 没显卡也能用
「云端模式」对硬件无要求——识别 + 翻译都在云端跑,只要能上网 + 装得下约 6 GB 绿色版,再普通的电脑都能出片,连大模型都不用下(详见「功能详解 · 云端模式」)。下面的显卡要求只针对本地模式。

本地模式硬件要求

  • 系统:Windows 10 / 11 64 位
  • 显卡:NVIDIA 显卡,最低 6 GB 显存(4 GB 极限档也能跑小模型),推荐 ≥ 12 GB
  • 无独显 / CPU 也能跑:小模型(Parakeet 英欧 ASR int8、FunASR 等)支持纯 CPU,只是慢一些
  • 内存:最低 16 GB,推荐 32 GB+;硬盘:程序约 6 GB,模型按需下载,建议预留 20 GB + SSD
开箱即用
常用小模型(Silero / FSMN 语音检测、Demucs 人声分离)已内置,无需下载。大模型(识别、翻译)首次使用时自动联网下载(默认走 ModelScope / HF-Mirror 国内镜像)。

激活

  1. 启动语幕,点击左下角「激活」图标(指纹按钮)
  2. 在弹出窗口粘贴卖家提供的激活码
  3. 点击「激活」,提示「激活成功」即可
语幕 激活页
激活页 · 复制机器码、粘贴激活码
说明
激活需联网(仅激活时,之后可离线使用),激活服务器在国内,无需梯子。一码一机;换电脑需联系卖家解绑。激活码前缀区分类型:Q- 次数卡 / M- 月卡 / Y- 年卡 / P- 永久版。

激活类型

类型有效范围用完 / 到期后
次数卡满功能 N 次,不限时长;一个视频完整跑完出字幕 = 1 次(中途取消 / 失败不计次)次数用完 → 回落试用模式
月卡 / 年卡有效期内不限次数、不限时长到期 → 降级回试用
永久版一次买断,永久全功能 + 后续更新

次数卡可叠加:再买一张次数累加(如 3 + 3 = 6 次),激活页会显示剩余次数。适合"先试真本事"或偶尔用几次。

试用版限制(激活后全部解除)
试用期 7 天且最多 8 次处理,单个视频 ≤ 5 分钟。以上限制只针对本地模式;云端模式不受激活 / 试用限制(没激活也能用、不限次数与时长),只要云端算力有余额。

下载模型(最容易卡在这一步)

语幕的小模型已内置、开箱即用;但识别(ASR)和翻译大模型第一次用到时需要下载(每个约 1~7 GB)。这一节看完就通。

☁ 用云端模式?这一步直接跳过
识别 / 翻译模型都不用下载(算力在云端),拖视频直接跑。

方式一:软件内自动下载(推荐)

  1. 左侧栏点 ☁️ 模型管理
  2. 找到要用的模型 → 点右侧「下载」,进度条走完变「已安装」
  3. 也可以不管它直接「开始处理」,用到的模型会自动开始下载

下载源自动走 ModelScope / HF-Mirror 国内镜像(无需梯子),支持断点续传和失败自动重试;自动下载到 C:\Users\你的用户名\.jav2ch\models\(自动管理)。

方式二:自动失败 → 夸克网盘手动下载(兜底)

  1. 网络不稳导致自动下载失败时,会自动弹出「手动下载」窗口。点窗口里的夸克网盘链接下载对应模型文件
  2. 回到「手动下载」窗口,点「选择已下载的文件」,选中刚下好的那个文件
最多人误解的一点
你不需要自己把文件拖进哪个目录!点「选择已下载的文件」后,软件会自动解压 / 复制到正确位置,完成后状态自动变「已安装」。
语幕 手动下载模型
「手动下载」窗口 · 从夸克网盘下好文件后点「选择已下载的文件」自动归位

该下哪个模型?(按语言)

你的视频识别模型翻译模型
日语(主打)Qwen3-ASR(日语精度最高)Hy-MT2
中文 / 韩语 / 其它亚洲语言Qwen3-ASR(同引擎直通)Hy-MT2
英语 / 欧洲语言Parakeet v3(欧洲 25 语专精,纯 CPU 也快)Hy-MT2
阿拉伯语 / 多语混合Whisper large-v3-turboHy-MT2

拿不准就点「一键适配显卡」,它会按你的显存自动选好识别 + 翻译模型。

界面总览

首次启动会弹出新手引导(3 页,只弹一次)。顶部有 5 个功能 Tab,覆盖字幕全流程:

语幕 新手引导
首次启动的新手引导
Tab作用
🎬 视频 → 字幕一站式:转录 + 翻译 +(可选)压制,最常用
🎤 语音转文字只出原文字幕(不翻译)
📝 字幕翻译把已有字幕文件译成中文 / 双语
✏️ 字幕编辑双语 ASS 双列对照,手动校对
🎞️ 字幕压制把字幕烧进视频(硬字幕)

左侧栏:🏠 主页 / 📄 日志 / ☁️ 模型管理 / 👆 激活 / ⚙️ 设置。

功能详解

5.1 视频 → 字幕(主流程)

  1. 把视频 / 音频拖到首页,或点「选择文件 / 选择文件夹」(支持 MP4 / MKV / AVI / WAV / FLAC 等)
  2. 视频语言(源)→ 字幕输出(目标),选 内容类型(影视·剧集 / 综艺 / 课程·访谈 / ASMR·音声)
  3. (建议)先点右上角「一键适配显卡」,自动按显存选最优配置
  4. 「开始处理」,进度条按阶段显示,完成后给出各阶段耗时

视频输出决定要不要顺手出成品视频:内嵌字幕·快(默认,字幕封装进 mkv,秒出,播放器可开关)/ 烧录字幕·慢(字幕烧进画面,重编码,拿去剪辑 / 传平台字体永不错乱)/ 不生成视频(只要字幕文件)。

☁ 本地模式 vs 云端模式(首页快捷配置右侧切换)
💻 本地(有显卡) — 默认,识别 + 翻译都在你电脑上跑,离线免费。
☁ 云端(无显卡) — 识别(qwen3-asr-flash)+ 翻译(DeepSeek-V4-Flash)走云端,不吃显卡,再破的电脑也能几分钟出片。切到「云端」→ 粘贴云端算力密钥 → 验证看余额 → 拖视频开始。按量付费,软件里实时显示余额与本次消耗。
语幕 云端模式
云端模式 · 语音识别 qwen3-asr-flash + 翻译 DeepSeek-V4-Flash,粘贴算力密钥即用

处理流程(进度条按此顺序,每阶段完成显示耗时):音频提取 →(可选)人声分离 → 预处理(音量归一)→ 语音检测(VAD)→(可选)说话人分离 → 分段 → 语音识别 → 后处理(去重 / 断句 / 过滤)→ 翻译 →(可选)内嵌 / 烧录出成品。中途可停、可续。

语幕 处理进度
处理进度 · 每阶段打勾并显示耗时,识别 / 翻译显示 N/M 段进度与 ETA

输出文件(位于 输出目录/<视频名>/):sub_zh.ass 中文字幕、sub_zh.srt(可选)、双语 ASS(可选)、成品视频 mkv(选内嵌 / 烧录时)。

5.2 语音转文字

只做识别、输出原文字幕(不翻译),用于只要听写稿的场景。识别模型下拉会标注每个模型所需显存与精度。

5.3 字幕翻译

上传已有字幕(.ass / .srt / .vtt),翻译成目标语言。输出可选双语(译文 + 原文)或单语。翻译模型:Hy-MT2 本地 / 云端算力 / OpenAI 兼容 API。

语幕 字幕翻译
字幕翻译 · 日语→中文,双语 / 单语输出,默认 Hy-MT2-7B

5.4 字幕编辑

打开字幕逐行校对,双语 ASS 两列对照。支持:双语编辑 · 拆分 / 合并行 · 时间平移 · 重翻译选中行 · 关联视频播放 · 12 种内置样式。

5.5 字幕压制

选视频 + 字幕,输出带字幕的视频,默认 NVENC 硬件加速。三种模式:烧录(硬字幕,任何播放器都能看,发布首选)/ 内嵌(软字幕,封进 MKV 不重编码,可开关)/ 仅复制字幕。

参数说明

6.1 预设场景(一选即调好一整套)

预设说明显存
通用模式(默认)默认配置,速度优先,说话人分离关12 GB
精校模式(高质量)最佳质量组合(1.7B ASR + 7B 翻译 + 说话人分离开)≥ 12 GB
快速模式(低显存 / 草稿)小模型 + 关 pre-analysis,省显存提速8 GB
ASMR 模式耳语 / 极低声优化(敏感 VAD)10 GB
动漫模式BGM 强场景优化(人声分离)12 GB

6.2 字幕样式编辑器

点「样式编辑器…」打开,上方 12 个预设卡片(经典白字 / 黑底白字 / B站弹幕风 / 双语主中文 / Netflix极简 / 综艺花字黄 / 经典黄字 / 蓝调描边 / 电影感衬线 等),选一个再微调,实时预览。可调:字体 / 主字号 / 副字号 / 主色 / 描边色 / 描边粗细 / 副字体 / 副色。双语字幕每屏 = 译文(大字)+ 原文(小字),超长句自动拆到多屏。

语幕 字幕样式编辑器
字幕样式编辑器 · 12 种预设 + 实时预览,字体 / 字号 / 颜色 / 描边全可调

6.3 高级设置(手动指定模型)

默认所有模型走「自动」(按 语言 × 显存 智能路由)。打开「高级设置」可手动覆盖:ASR 模型、VAD 后端、音频源、翻译后端 / 模型等。

各识别模型简介:

  • Qwen3-ASR 1.7B :日 / 中 / 韩 / 泰 / 越等亚洲语言高精度(日语 Fleurs WER 5.20%,业界最高),困难场景鲁棒,字级时间戳;需 ~11 GB
  • Qwen3-ASR 0.6B:1.7B 轻量版,语言覆盖相同,8~10 GB 自动选用
  • Parakeet-TDT 0.6B v3:英 + 欧洲 25 语专精(GPU 5.6 GB / CPU int8 ~12x 实时),英语 Fleurs 4.85%
  • Kotoba v2.0-faster:日语专精,仅需 4 GB,快
  • Whisper large-v3-turbo:多语言通用,快;非专精语言 / 低显存兜底
  • SenseVoice Small:< 2 GB 纯 CPU 兜底,多语言
  • Anime-Whisper:动漫 / 音声拟声(气声、环境声)专精(对白仍推荐 Qwen3)

翻译后端:Hy-MT2-7B 本地 (腾讯混元翻译 2 代,33 语,信达雅、重复幻觉少)/ Hy-MT2-1.8B(低显存)/ OpenAI 兼容 API / ☁ 云端算力(默认 DeepSeek-V4-Flash,无需自备 Key)。译前还会做全量分析(人物表 / ASR 纠错 / 剧情摘要)注入翻译。

推荐配置速查

显存日语 ASR中 / 韩 ASR英 / 欧 ASR翻译
☁ 无显卡 / 嫌慢云端 qwen3-asr-flash云端 DeepSeek
12 GB(默认)Qwen3-ASR 1.7BQwen3-ASR 1.7BParakeetHy-MT2-7B
10 GBQwen3-ASR 0.6BQwen3-ASR 0.6BParakeetHy-MT2-7B / 1.8B
8 GBQwen3-ASR 0.6BQwen3-ASR 0.6BParakeetHy-MT2-1.8B
6 GBKotoba v2.0Whisper turboWhisper turboHy-MT2-1.8B
纯 CPU / 无卡☁ 建议云端Parakeet int8(CPU 也快)☁ 云端 / 1.8B
拿不准?
「一键适配显卡」,它会按你的显存自动设到上面这些档位,你只管下载。

常见问题

处理很慢 / 卡在某阶段

音频提取与人声分离(Demucs)较慢属正常;不需要人声分离时在高级设置里关掉能省很多时间。识别 / 翻译走 GPU,确认没有别的程序占用显卡。

显存不足 / CUDA out of memory

点「一键适配显卡」自动降档;或手动换更小 ASR(1.7B→0.6B)、关 pre-analysis、调小 batch、关人声分离。

第一次用,一直在下载模型

识别和翻译大模型第一次用到时要联网下(每个 1~7 GB),这是正常的。建议开始处理前先在「模型管理」把要用的模型下好。小模型已内置无需下载。

模型下载很慢 / 失败

默认走国内镜像(无需梯子),可在「模型管理」重试,支持断点续传。实在下不动 → 用夸克网盘手动下载兜底:下好文件后点「选择已下载的文件」,软件自动归位,不用自己放目录。

生成的 mkv 打不开 / 黑屏

多半是源视频是 AV1 编码,「内嵌」模式不改视频流,老播放器不支持 AV1 就放不出来。办法:① 换支持 AV1 的播放器(新版 PotPlayer / VLC / mpv);② 「视频输出」选烧录(重编码为 H.264,任何设备都能放)。

内嵌和烧录选哪个?

自己在电脑上看 → 内嵌(秒出、无损、可开关字幕);要拿去剪辑或上传平台 → 烧录(字幕烧进画面,任何设备 / 平台字体永不错乱)。

激活失败

确认联网(无需梯子);检查激活码大小写 / 横线 / 空格;一码一机,换机需联系卖家解绑;杀软 / 防火墙可能拦截,临时关闭再试。

软件无法启动 / 双击没反应

确认 NVIDIA 显卡 + 较新驱动;确认 _internal 文件夹完整未被杀毒删除;路径尽量英文;试管理员权限运行。

售后联系

购买后添加,方便售后与更新通知:

  • 微信:yooooloooov8
  • QQ:3091184072
  • 交流 / 求助 QQ 群:1075669841(问题群里互助、更新通知,推荐加)