零网络请求
本地引擎完全离线,模型首次下载后不再联网。你的会议、网课、私聊内容,一个字节都不会出门。
从 234MB 的轻量模型到 1.7B 的多语种大模型,从纯 CPU 到 GPU 原生流式——在设置里一键切换,管线与界面完全不用改。「引擎管理」标签页还会告诉你每个引擎装没装好,没装就给你精确命令一键复制。
本地引擎模式下,音频从系统输出到字幕上屏,全程不产生任何网络请求。
本地引擎完全离线,模型首次下载后不再联网。你的会议、网课、私聊内容,一个字节都不会出门。
AccessKey / Secret 只存进 Windows Credential Manager、macOS Keychain 或 Linux Secret Service,绝不写进配置文件。
凭证不会被 git add . 误提交,不怕截图分享,不怕同步盘悄悄上传到云端。
每一行代码都摊开在阳光下。没有黑盒,没有埋点,你看到的就是它运行的全部。
无边框、半透明、永远置顶。它浮在所有窗口之上,只在需要的时候露出工具栏。
同时监听系统声音和麦克风,两路独立引擎配置。FunASR + cam++ 实时区分说话人,还能给每个人起名字。
内置可视化皮肤编辑器:图层、序列帧、关键帧、缓动、事件触发——把字幕条变成你的桌宠舞台。
从 Dark 到 Dracula,内置七套主题;改坏了能一键恢复,自定义主题支持 JSON 导入导出。点下面的色板试试。
声音所到之处,皆有字幕。
DARKWindows + NVIDIA GPU 是最顺滑的组合。装好 Miniconda 之后,剩下的交给两个批处理脚本。
从官网下载 Windows 安装包,一路默认即可。已有 conda 环境可跳过。
自动创建 subtitle 环境(Python 3.11),装好 funasr、PySide6 与 CUDA 12.1 版 torch。
首次启动自动从 ModelScope 下载模型(约 1GB),之后字幕就开始跟着声音走了。
# 1. 创建环境(或直接双击 scripts\setup_env.bat)
C:\> conda env create -f environment.yml
C:\> conda activate subtitle
# 2. 安装 GPU 版 torch(注意是 --index-url,不是 --extra-index-url)
C:\> pip install torch torchaudio --index-url https://download.pytorch.org/whl/cu121
# 3. 启动(或直接双击 run.bat)
C:\> set PYTHONPATH=src
C:\> python -m subtitle
✓ 字幕窗口已置顶,开始说话吧。
没有 GPU?设置里切到 SenseVoice,CPU 就能跑;或者用阿里云 NLS API,任意设备即开即用。
可以。选 SenseVoice 引擎,234M 小模型在 CPU 上就能流畅运行,适合 Mac 和无独显设备;也可以直接用阿里云 NLS API,任意设备都行。
Whisper 类模型在静音、音乐暂停和片尾可能编造不存在的台词,VAD 只能缓解。中文音乐、歌词场景请优先使用 Fun-ASR-Nano 或 Qwen3-ASR。
Windows 10 / 11 体验最完整——系统声音捕获基于 WASAPI loopback。SenseVoice 引擎基于 PyTorch,macOS 与 Linux 也可以跑。
统一从 ModelScope 自动下载,首次运行对应引擎时触发,之后完全离线。仓库本身不包含任何模型权重。
软件以 MIT 协议开源,完全免费。只有选择阿里云 NLS API 引擎时才按语音时长计费,新用户通常有免费额度。
FunASR 引擎内置 cam++ 声纹模型,流式输出 spk_id。程序会在字幕前自动标注说话人编号,你可以在设置里把编号改成真实姓名或昵称,按输入源分别记忆。
可以。双输入源模式下,系统声音和麦克风各自独立采集、独立配置引擎。比如电脑声音用 FunASR 低延迟流式,麦克风用 SenseVoice 省显存——两路字幕在同一个窗口里用不同图标区分。
正在为 exe / dmg 打包做跨平台兼容。SenseVoice 和 faster-whisper 引擎基于 PyTorch / CTranslate2,macOS 和 Linux 上已经可以跑;系统声音捕获目前 Windows 最完整(WASAPI loopback),其他平台可用麦克风输入替代。