本地离线字幕:PotPlayer + Faster-Whisper + Ollama,一条不联网的 AI 字幕/翻译链路

用 PotPlayer + Faster-Whisper-XXL + PotPlayer ollama Translate + Ollama + gemma3:4b 搭一条纯本地的 AI 字幕与翻译链路:Whisper 做语音识别出字幕,本地 LLM 做翻译,全程不联网、无延迟、不泄隐私。本文讲清这条链路的分工、为什么选本地、工具清单与官方地址、适用场景与硬件限制。

看外语视频、追生肉动漫、听英文讲座时,“字幕"几乎是刚需。但主流字幕工具大多走云端:上传音频 → 云端识别 → 云端翻译 → 回传。快是快,代价也明显——视频/音频要离开你的电脑,识别和翻译都有网络延迟,免费额度有限。

其实现在这套能力已经能完全跑在本机:语音识别交给 Whisper,翻译交给本地大模型,播放器负责把结果渲染成双语字幕。 全程不联网。

目录

  1. 一条链路解决什么问题
  2. 四个组件的分工
  3. 为什么一定要本地
  4. 工具清单与官方地址
  5. iOS 替代:快字幕
  6. 适用场景与硬件限制

一、一条链路解决什么问题

一句话:让"听外语视频 → 出中文字幕"这件事,在你的电脑上原地完成。

链路分两段:

  • 第一段:语音 → 文字。Whisper 系列模型擅长多语言语音识别,能直接把音频转写成带时间戳的文本,输出 SRT 字幕。
  • 第二段:文字 → 翻译。转写出的字幕文本被播放器插件送到本地大模型,模型把原文翻译成中文,再以双语形式叠加回画面上。

两段都在本机完成,中间不经过任何云端服务。

二、四个组件的分工

组件角色干什么
PotPlayer播放器宿主负责播放视频、加载字幕插件、渲染双语字幕
Faster-Whisper-XXL语音识别引擎基于 CTranslate2 加速的 Whisper Windows 独立版,把音频转成 SRT 字幕
PotPlayer ollama Translate翻译桥PotPlayer 的翻译插件,把当前字幕文本送到本地 Ollama 服务翻译
Ollama + gemma3:4b本地翻译模型Ollama 是本地大模型运行器,gemma3:4b 是 Google 的多语言小模型,体积适中,适合做字幕翻译

关键点在于各组件职责清晰、可替换:Whisper 想换别的识别引擎也行,翻译模型想换其他本地 LLM 也只需换 Ollama 里的模型。播放器只负责"接活儿”,不锁死任何一家。

三、为什么一定要本地

云端字幕工具不是不好用,而是对一部分场景不合适。本地方案的价值集中在三点:

隐私。 音频、视频内容全程不出本机。对于会议录音、内部资料、未公开的讲座,这一点是硬需求——你未必愿意把内容上传到某个服务商的服务器。

零延迟、可离线。 识别和翻译都在本地跑,不受网络波动影响,断网照常工作。也没有上传等待时间,字幕几乎是同步出的。

免费且不限额。 Whisper 和 Ollama 都是开源项目,gemma3:4b 是开源模型。一次部署,长期使用,没有按分钟计费或字幕条数限制。

当然,本地也有代价——要占你的硬件资源。识别和翻译都是计算密集型的,显卡越好越快(详见第六节)。

四、工具清单与官方地址

组件地址说明
PotPlayerhttps://potplayer.daum.net/播放器本体,官网下载
Faster-Whisper-XXLhttps://github.com/Purfview/whisper-standalone-winWindows 独立版,免 Python 环境
Whisper 模型说明https://github.com/openai/whisper模型大小与语言支持对照
PotPlayer ollama Translatehttps://github.com/yxyxyz6/PotPlayer_ollama_Translate翻译插件
Ollamahttps://ollama.com/本地 LLM 运行器
gemma3:4b通过 Ollama 拉取:ollama pull gemma3:4bGoogle 多语言模型,开源

安装完 Ollama 后,用 PowerShell 验证并拉取模型:

# 检查 Ollama 是否安装成功
ollama --version

# 从 Ollama 官方服务器拉取 gemma3:4b(约数 GB)
ollama pull gemma3:4b

# 确认模型已就位
ollama list

具体到 PotPlayer 里的插件安装、字幕插件触发方式等细节,以各项目官方文档为准——不同版本的插件界面和接线方式可能有差异。这里给出的是组件定位和接线思路,不是逐像素的操作指南。

五、iOS 替代:快字幕

如果场景在手机上、而且想更省事,有一个完全离线的 iOS 选择:快字幕。

特性说明
纯本地处理100% 设备端运算,不上传任何数据
AI 语音识别自动识别视频语音,生成精准字幕
多语种翻译中、英、日、韩、法、德等,AI 双语对照
字幕导出SRT、VTT 专业格式,适配剪辑软件
视频烧录把字幕直接烧进视频,一键导出带字幕的 MP4

地址:https://apps.apple.com/app/id6771306934

它的定位和 PC 方案互补:PC 端适合"看视频 + 实时翻译",手机端适合"拍了视频快速出字幕、导出剪辑"。

六、适用场景与硬件限制

适合:

  • 看外语影视、生肉动漫、英文讲座,想要中文字幕;
  • 处理会议录音、讲座视频,需要快速出文字稿;
  • 隐私敏感的内容,不想上传云端;
  • 想批量给视频加字幕(短视频剪辑、二次创作)。

要提前想清楚的限制:

限制说明
硬件门槛Whisper 识别和 LLM 翻译都吃算力,独显(尤其 N 卡)体验远好于纯 CPU;核显或低配机速度会明显偏慢
内存占用gemma3:4b 约数 GB 内存,模型常驻;识别引擎也会占内存
模型体积Whisper 大模型、gemma3:4b 都需要下载数 GB 模型文件,需预留磁盘空间
首次部署成本装 4~5 个组件 + 拉模型,一次性投入,之后长期免费

如果只是偶尔看外语视频、不介意联网,云字幕工具依然是最省事的;但如果隐私、离线、批量、长期使用是刚需,这条本地链路值得搭一次。


项目信息

项值
播放器PotPlayer(https://potplayer.daum.net/)
语音识别Faster-Whisper-XXL(https://github.com/Purfview/whisper-standalone-win)
翻译桥PotPlayer ollama Translate(https://github.com/yxyxyz6/PotPlayer_ollama_Translate)
本地模型Ollama + gemma3:4b(https://ollama.com/)
iOS 方案快字幕(https://apps.apple.com/app/id6771306934)

本文为原创整理,介绍各开源组件的定位与接线思路,未逐字搬运任何来源文章;具体安装与配置步骤以各项目官方文档为准。