看外语视频、追生肉动漫、听英文讲座时,“字幕"几乎是刚需。但主流字幕工具大多走云端:上传音频 → 云端识别 → 云端翻译 → 回传。快是快,代价也明显——视频/音频要离开你的电脑,识别和翻译都有网络延迟,免费额度有限。
其实现在这套能力已经能完全跑在本机:语音识别交给 Whisper,翻译交给本地大模型,播放器负责把结果渲染成双语字幕。 全程不联网。
目录
一、一条链路解决什么问题
一句话:让"听外语视频 → 出中文字幕"这件事,在你的电脑上原地完成。
链路分两段:
- 第一段:语音 → 文字。Whisper 系列模型擅长多语言语音识别,能直接把音频转写成带时间戳的文本,输出 SRT 字幕。
- 第二段:文字 → 翻译。转写出的字幕文本被播放器插件送到本地大模型,模型把原文翻译成中文,再以双语形式叠加回画面上。
两段都在本机完成,中间不经过任何云端服务。
二、四个组件的分工
| 组件 | 角色 | 干什么 |
|---|---|---|
| PotPlayer | 播放器宿主 | 负责播放视频、加载字幕插件、渲染双语字幕 |
| Faster-Whisper-XXL | 语音识别引擎 | 基于 CTranslate2 加速的 Whisper Windows 独立版,把音频转成 SRT 字幕 |
| PotPlayer ollama Translate | 翻译桥 | PotPlayer 的翻译插件,把当前字幕文本送到本地 Ollama 服务翻译 |
| Ollama + gemma3:4b | 本地翻译模型 | Ollama 是本地大模型运行器,gemma3:4b 是 Google 的多语言小模型,体积适中,适合做字幕翻译 |
关键点在于各组件职责清晰、可替换:Whisper 想换别的识别引擎也行,翻译模型想换其他本地 LLM 也只需换 Ollama 里的模型。播放器只负责"接活儿”,不锁死任何一家。
三、为什么一定要本地
云端字幕工具不是不好用,而是对一部分场景不合适。本地方案的价值集中在三点:
隐私。 音频、视频内容全程不出本机。对于会议录音、内部资料、未公开的讲座,这一点是硬需求——你未必愿意把内容上传到某个服务商的服务器。
零延迟、可离线。 识别和翻译都在本地跑,不受网络波动影响,断网照常工作。也没有上传等待时间,字幕几乎是同步出的。
免费且不限额。 Whisper 和 Ollama 都是开源项目,gemma3:4b 是开源模型。一次部署,长期使用,没有按分钟计费或字幕条数限制。
当然,本地也有代价——要占你的硬件资源。识别和翻译都是计算密集型的,显卡越好越快(详见第六节)。
四、工具清单与官方地址
| 组件 | 地址 | 说明 |
|---|---|---|
| PotPlayer | https://potplayer.daum.net/ | 播放器本体,官网下载 |
| Faster-Whisper-XXL | https://github.com/Purfview/whisper-standalone-win | Windows 独立版,免 Python 环境 |
| Whisper 模型说明 | https://github.com/openai/whisper | 模型大小与语言支持对照 |
| PotPlayer ollama Translate | https://github.com/yxyxyz6/PotPlayer_ollama_Translate | 翻译插件 |
| Ollama | https://ollama.com/ | 本地 LLM 运行器 |
| gemma3:4b | 通过 Ollama 拉取:ollama pull gemma3:4b | Google 多语言模型,开源 |
安装完 Ollama 后,用 PowerShell 验证并拉取模型:
# 检查 Ollama 是否安装成功
ollama --version
# 从 Ollama 官方服务器拉取 gemma3:4b(约数 GB)
ollama pull gemma3:4b
# 确认模型已就位
ollama list
具体到 PotPlayer 里的插件安装、字幕插件触发方式等细节,以各项目官方文档为准——不同版本的插件界面和接线方式可能有差异。这里给出的是组件定位和接线思路,不是逐像素的操作指南。
五、iOS 替代:快字幕
如果场景在手机上、而且想更省事,有一个完全离线的 iOS 选择:快字幕。
| 特性 | 说明 |
|---|---|
| 纯本地处理 | 100% 设备端运算,不上传任何数据 |
| AI 语音识别 | 自动识别视频语音,生成精准字幕 |
| 多语种翻译 | 中、英、日、韩、法、德等,AI 双语对照 |
| 字幕导出 | SRT、VTT 专业格式,适配剪辑软件 |
| 视频烧录 | 把字幕直接烧进视频,一键导出带字幕的 MP4 |
地址:https://apps.apple.com/app/id6771306934
它的定位和 PC 方案互补:PC 端适合"看视频 + 实时翻译",手机端适合"拍了视频快速出字幕、导出剪辑"。
六、适用场景与硬件限制
适合:
- 看外语影视、生肉动漫、英文讲座,想要中文字幕;
- 处理会议录音、讲座视频,需要快速出文字稿;
- 隐私敏感的内容,不想上传云端;
- 想批量给视频加字幕(短视频剪辑、二次创作)。
要提前想清楚的限制:
| 限制 | 说明 |
|---|---|
| 硬件门槛 | Whisper 识别和 LLM 翻译都吃算力,独显(尤其 N 卡)体验远好于纯 CPU;核显或低配机速度会明显偏慢 |
| 内存占用 | gemma3:4b 约数 GB 内存,模型常驻;识别引擎也会占内存 |
| 模型体积 | Whisper 大模型、gemma3:4b 都需要下载数 GB 模型文件,需预留磁盘空间 |
| 首次部署成本 | 装 4~5 个组件 + 拉模型,一次性投入,之后长期免费 |
如果只是偶尔看外语视频、不介意联网,云字幕工具依然是最省事的;但如果隐私、离线、批量、长期使用是刚需,这条本地链路值得搭一次。
项目信息
| 项 | 值 |
|---|---|
| 播放器 | PotPlayer(https://potplayer.daum.net/) |
| 语音识别 | Faster-Whisper-XXL(https://github.com/Purfview/whisper-standalone-win) |
| 翻译桥 | PotPlayer ollama Translate(https://github.com/yxyxyz6/PotPlayer_ollama_Translate) |
| 本地模型 | Ollama + gemma3:4b(https://ollama.com/) |
| iOS 方案 | 快字幕(https://apps.apple.com/app/id6771306934) |
本文为原创整理,介绍各开源组件的定位与接线思路,未逐字搬运任何来源文章;具体安装与配置步骤以各项目官方文档为准。