自 v1.5.0 起的翻译引擎更新。
- 全新 8 家预设 — DeepSeek / Kimi / 日日新(商汤)/ MiniMax / 豆包 / 混元 / OpenRouter / 自定义:选卡片一键填好接口地址和默认模型,各家的 Key 独立保存、随时切换
- 日日新 Token 计划 — 在售模型全部免费,注册拿 Key 即可开箱使用
- 接口协议升级为 Anthropic Messages — 官方端点与 one-api / new-api 等中继网关都能直连(认证双通道同发)
- 注意 — 服务商列表有更替(移除通义 / Gemini / Ollama / ChatGPT 槽位),旧配置不自动迁移,升级后请在设置里重新选择服务商并填入 Key
- 限流、服务端拥堵、网络抖动自动重试;服务器建议的等待时长会被尊重,但设有上限,不会卡死任务
- 连通性测试遇到免费档高峰拥堵会自动快速重试,不再把「对方太挤」误报成配置错误
- 服务商不支持结构化输出时自动回退,翻译照常进行
- 失败提示透传服务商原始错误信息,Key / 地址 / 模型哪里填错一眼可见
自 v1.4.3 起的功能更新。
- 术语 Agent(可开关) — 翻译前自动通读全片字幕,整理出本片专属术语表和翻译风格说明,人名、地名、作品名、专有说法全片统一,不再前后不一
- 可联网核实译名 — 设置里填入联网搜索 Key 后,Agent 遇到拿不准的专名会联网查证;留空则用免费端点
- 失败不阻断 — Agent 出错或超时自动跳过,翻译照常进行;你自己在术语表里填的译名始终优先生效
- 设置中「术语 Agent」与「联网搜索」并排展示,一键跳转获取 Key
- 术语 Agent 进度在任务阶段中实时可见(窗口 / 轮次)
自 v1.4.2 起的功能更新。
- 日语断句按语言习惯处理 — 口语停顿、接续和数字黏连更自然,长度预设仍然生效
- 字幕编辑更紧凑 — 原文/译文默认单行,内容变长再展开
- 审核开关更好懂 — 改到「导出」左侧,文案为「翻译前审原文」「定稿前审译文」;悬停可看说明
- 去掉视觉抽帧和单独术语提取阶段,减少超时和整单失败
- 翻译提示词更短,模型只负责把当前字幕翻成目标语言
- 按字幕 id 收取译文,返回格式怎么包都不容易整批作废
- 缺句或格式不对时,用「原文 + 已有译文」补全,不再把整批重翻一遍
- 下一批会看到上一批的「原文 → 译文」;上下文改为前 3 句、后 2 句
- 各目标语言都会做过短/闪一下的字幕合并(去标点美化仍只作用于中日韩)
- 短字幕不再一闪而过:不足 0.5 秒且后面有空位时延长到 0.5 秒;本来已满 0.5 秒、离下一句不超过 1 秒时,结束时间接到下一句开始,中间不留白
- 译文里的英文引号本地转义:模型把引号写进 JSON 却没加反斜杠时,代码直接修好再解析,不再整批失败去让模型修 JSON
- 修复日语 + Qwen 对齐失败:日语分词模型已内嵌,不再依赖额外模型目录
- 修复长音频转录卡死:部分长音频转到后半段会停住不动、内存越占越多甚至报错,建议所有人都更新
- 长音频末尾的零碎小段自动并入上一段,识别更稳、字幕更连贯
- 整体提速:转录、翻译、导出都更快;媒体多、字幕长时界面滚动更流畅
- 字幕保存更可靠:编辑后导出/审阅时确保写入的是最新内容
自 v1.3.1 起的功能更新。
- 转译双独立审核关卡
- 源稿审核:识别完成后、翻译前暂停,可在字幕编辑器改原文,确认后点「继续翻译」
- 译稿审核:翻译完成后暂停,可改译文,确认后点「完成定稿」
- 设置中可配置「默认源稿审核 / 默认译稿审核」(仅对新任务生效)
- 字幕编辑器内可按任务单独开关
- 审核期间占住流水线槽位,避免后续任务抢跑
- 若开启译稿审核,自动压制改在「完成定稿」后执行
- 补全缺失的阶段与预设 i18n 文案(如压制阶段、样式预设名称)
- 修复 CUDA 版默认 CTC 对齐在部分 N 卡上失败(日志常见
CUDA init failed (device 0): CudaKernels::load_all) - 根因:MMS CTC 引擎预编译 PTX 缺符号(尤其 sm70–sm90,含 RTX 40 系 / sm_89),与「未下载对齐模型」无关
- 已重生多架构 PTX 并加符号自检,避免再次发版漂移
受影响用户: 使用 CUDA 版 + 默认 mms-300m CTC 对齐 的 N 卡用户(含 4060 笔电)。自动更新到 1.3.1 即可;无需重装驱动 / CUDA Toolkit。
临时绕过(未更新前):设置里改用 Qwen3-ForcedAligner,或执行后端改 CPU。
自 v1.2.1 起的功能更新。
- 多厂商 LLM 配置 — 按服务商独立保存 API 配置(OpenAI / DeepSeek / 通义 / 豆包 / Gemini / OpenRouter / Ollama 等),可一键套用预设,翻译时使用当前激活配置
- 多引擎时间轴对齐 — 对齐支持 Qwen 与 MMS CTC 两套引擎,默认 CTC;模型中心可选择时间轴对齐模型
- 分段时长可调范围扩大 — ASR 目标分段由 30–60s 调整为 30–180s,产品默认 60s(已保存的自定义值不变)
- 更新提示改为版本号旁弹层 — 点击导航栏版本徽章弹出更新信息,下载进行中不会轻易误关
- 翻译连通性测试与模型列表拉取更稳妥,请求路径按激活 profile 处理
- 翻译失败重试更智能 — 一次汇总缺漏/空译/重复等问题;重试时附带上一轮输出并要求整批重交;先空后补的条目可自动恢复
- CUDA 版大幅提升兼容性:有 N 卡一般只需装好较新的显卡驱动即可加速,不必再装 CUDA Toolkit
- 驱动过旧(例如 nvidia-smi 显示 CUDA 12.3)请先升级驱动
- 常见游戏卡(含 20 系如 2080 Ti)在驱动足够新时可用
- 安装包仍然不大;首次安装 CUDA 版会自动下载加速所需文件
- 模型管理去掉「一键下载当前 ASR + 对齐」按钮,改为各模型单独下载
- 其他稳定性相关小修复
自 v1.1.0 起累计的主要更新(用户可见功能与修复)。
- MOSS-Transcribe-Diarize — 第三 ASR 后端(固定约 180s 分段,产品侧输出纯文本)
- 模型管理界面重做 — 分组 ASR 单选列表 + 标签;对齐 / 人声分离单独分区
- 自定义模型目录 — 设置中可选择模型存放路径
- 真正 token 级流式翻译预览 — 批次内译文边生成边在字幕编辑器中生长;不支持流式的接口自动回退
- 界面语言切换 — 导航栏中文 / English 一键切换并持久化
- 源语言按模型动态列表 — 补俄语;Qwen / Cohere 支持语种与官方能力对齐
- 更新弹窗 Markdown 渲染 — Release 说明正常显示标题、列表等排版
- 英文断句接入更好的句界检测,断句更自然
- 中文断句禁止从词中间切开
- VAD 分段阈值微调,字幕切分更稳
- 选用 MOSS 时分段时长 UI 提示固定 180s
- ASR / 对齐进度改为 1 基「正在处理」
1/N … N/N
- i18n 命名空间分隔符修正(日志标题等不再显示键名)
- 断点续跑、错误处理与模型下载取消后进度异常
- 长视频术语提取窗口过大导致 LLM 超时
功能更新与质量提升
- 视觉辅助翻译 — 翻译时自动提取视频关键帧,帮助 LLM 结合画面语境产出更准确的译文(设置中开启)
- Cohere Transcribe ASR — 新增 Cohere 转录引擎作为第二后端,设置中可切换
- 自动硬字幕压制 — 任务完成后自动将字幕烧录到视频中,无需手动触发
- 翻译进度实时流式 — 翻译过程实时显示在字幕编辑器中,无需等待批次结束
- 字幕样式预设 — 内置"经典院线""流媒体极简""人文纪录片"等多种样式模板,一键应用
- Step2 分句改用 DP 全局最优算法,替代原有贪心策略,断句更自然
- VAD 辅助分句 — 引入语音活动检测辅助分段边界判断,减少句子被硬切断的情况
- 中文 jieba 分词 — 中文断句质量提升,正确处理词边界
- 吸收 DP 产生的过短片段,避免单独的语气词成段
- 持久化迁移至 SQLite — 任务状态、字幕段、术语库、设置全部改用 SQLite 存储,断点续跑更可靠,进程被杀后未完成的子单元会自动重算
- 术语库组选择在入队时冻结,改设置不会影响已排队任务
- 任务列表入队顺序稳定,不再因并发导致乱序
- 修复硬字幕压制在特定样式配置下(描边为 0)字幕不可见的问题
修复 N 卡用户 CUDA 版启动报"找不到 cudart64_12.dll"等 DLL 缺失问题
- CUDA 版不再需要装 CUDA Toolkit,装好 NVIDIA 驱动即可
- CUDA Runtime 4 个 DLL 改为安装时从 ModelScope 下载(国内直连,1-3 分钟)
- 目标用户:之前 CUDA 版用不了的 N 卡用户。CUDA 版之前能正常用的用户无需更新
修复
- 字幕编辑器修改内容后导出仍是原始版本的问题
新功能
- 转录引擎从 Parakeet 升级为 Qwen3-ASR
- 新增多语言支持(中英粤日韩法德意西葡等)
- 转录完全离线运行,无需网络
- 新增内置在线更新,后续版本自动检测升级
说明
- 翻译仍走 LLM,需自行配置 API