RepoDaily · 2026-06-29 · Infrastructure / Runtime

FluidVoice:macOS 上最快的本地优先语音转文字运行时

#6 Infrastructure / Runtime Swift +491 altic-dev/FluidVoice 打开仓库

FluidVoice 为 macOS 带来近乎零延迟的设备端语音识别,支持八种可切换模型、私有 AI 增强层,完整 GPLv3 源代码开放——无需云端。

项目类型Infrastructure / Runtime
最适合使用 Apple Silicon 芯片 Mac、需要快速、隐私、离线语音转文字且希望自主选择模型和设备端后处理的用户
风险等级medium
评估时间10 分钟

核心问题: FluidVoice 的本地 Parakeet 实现是否比你当前使用的语音转写工具延迟更低、隐私更强?

88/100

RepoDaily 采用评分

RepoDaily 将该项目的采用分评为 88/100(强):分数来自文章来源、安装路径、生产风险、差异化、许可证清晰度以及 AI/Agent 适配度。

基于 RepoDaily 来源和采用说明的方向性评分,不是基准测试。风险: 中
100证据质量

包含 4 个来源、覆盖 4 类来源;如有 RepoDaily 独有模块,会进一步提高证据分。

92可安装/可试用性

检测到 6 个工作流步骤、5 个下一步动作,以及 1 个命令/安装信号。

63维护可信度

趋势热度为 +491 stars;如内容中有 release、issue 或维护信号,会提高维护可信度。

93生产准备度

采纳风险标记为 medium,并包含 5 条安全说明与 4 条跳过条件。

100差异化

3 个机会视角、4 个替代方案,以及 3 个类型化模块支撑差异化判断。

82许可证清晰度

文章中包含许可证来源或许可证表述。

72Agent / AI 适配度

文章正文和元数据中检测到 4 个 AI/Agent 相关信号。

项目概览

FluidVoice 是一款使用 Swift 编写的开源 macOS 语音听写应用,完全在设备端将语音转换为文字。除非你主动选择接入外部 AI 服务商,否则音频和转写文本不会经过任何云端服务。项目采用 GPLv3 许可证,可通过 Homebrew 安装(`brew install --cask fluidvoice`),也可从 GitHub Releases 页面手动下载。

README 中重点介绍的 1.6.0 版本引入了重新构建的 Parakeet 实现,开发者称其实现了从说话到屏幕显示文字之间近乎零延迟。同一版本首次推出 Fluid Intelligence——一个私有维护的本地 AI 运行时,负责智能格式化、上下文感知大写和后处理,全部在 Mac 本地运行,不向外部发送任何数据。

核心差异在于模型多样性。FluidVoice 支持八种语音识别引擎:Nemotron Speech 3.5(超快版和多语言版)、Parakeet Flash(测试版)、Parakeet TDT v3 和 v2、Cohere Transcribe、Apple Speech 以及 Whisper(从 Tiny 到 Large)。用户可根据语言覆盖范围、延迟容忍度和存储预算选择模型,下载体积从内置(Apple Speech)到约 2.9 GB(Whisper Large)不等。

在基础转写之外,应用提供两种操作模式。Command Mode 允许通过语音控制 macOS——启动应用、运行快捷指令、触发系统操作。Write Mode 通过辅助功能 API 直接在任何应用的文本框中插入或重写文本。全局热键可从任意位置激活语音采集,无需切换应用,刘海屏感知的实时预览浮层会显示转写过程。

解决什么问题

  • 大多数听写工具——包括 Apple 内置选项——要么缺乏低延迟设备端模型,要么需要将音频发送到第三方服务器的云端处理
  • 基于云端的听写服务产生持续订阅费用,并为处理敏感或受监管内容的用户带来隐私风险
  • 现有的开源语音工具如 Whisper 需要技术配置、命令行操作或封装应用,缺乏全局热键、实时浮层和按应用配置功能
  • 有多语言需求的用户通常必须在英语优化的快速模型和较慢的多语言模型之间做出选择,无法轻松按任务切换

工作原理

  1. 通过 `brew install --cask fluidvoice` 安装,或从 GitHub Releases 页面下载最新版本
  2. 在引导流程中授予 macOS 辅助功能和麦克风权限,新版引导包含语言优先的语音引擎设置和实时听写试用
  3. 根据硬件、语言和延迟需求选择语音模型——Parakeet TDT v3 是覆盖 25 种语言的默认选择(约 500 MB),Parakeet Flash 面向最低延迟英语(约 250 MB)
  4. 可选启用 Fluid Intelligence 进行本地 AI 后处理,或配置外部服务商(OpenAI、Groq 或自定义端点)进行云端增强
  5. 按全局热键开始听写;刘海屏感知浮层显示实时转写,Smart Typing 通过辅助功能 API 将文本直接插入当前应用
  6. 根据任务在 Command Mode(语音控制 macOS 操作)和 Write Mode(内联文本插入和重写)之间切换

产品演示与界面预览

Command Mode
Command Mode 界面 — Command Mode 允许用户通过语音触发 macOS 操作——应用启动、快捷指令、系统控制——无需触碰键盘。 README.md image
History & Stats
历史记录与使用统计 — 历史与统计面板显示每日使用追踪和可选的本地音频录音(支持 ZIP 导出),方便查看过往听写。 README.md image

架构解读:本地优先运行时与可切换模型后端

  • 核心听写应用为 GPLv3 Swift 代码;语音模型层接受八种后端:Nemotron Speech 3.5(超快版约 670 MB、多语言版约 530 MB)、Parakeet Flash 测试版(约 250 MB)、Parakeet TDT v3(约 500 MB,25 种语言)、Parakeet TDT v2(约 500 MB,仅英语)、Cohere Transcribe(约 1.4 GB,14 种语言)、Apple Speech(内置,Intel + Apple Silicon)以及 Whisper Tiny 到 Large(约 75 MB 至 2.9 GB,99 种语言)
  • Fluid Intelligence 是独立、私有维护的本地 AI 运行时——不属于 GPLv3 源代码——负责智能格式化、上下文感知大写和后处理
  • 文本插入使用 macOS 辅助功能 API(Smart Typing)而非剪贴板模拟,确保在任何应用的文本框中可靠输入
  • 所有 Nemotron、Parakeet 和 Cohere 模型均要求 Apple Silicon;仅 Apple Speech 和 Whisper 支持 Intel Mac
  • Per-App Configuration 允许为不同应用分配不同的提示词集,使听写格式化按上下文自适应

试用路径:从安装到首次听写

  • 运行 `brew install --cask fluidvoice`——cask 会自动放置到 /Applications
  • 首次启动时,刷新的引导流程一步完成权限授予、模型选择、实时听写试用和可选 AI 增强设置
  • 从 Parakeet TDT v3(约 500 MB 下载)开始体验多语言覆盖,或选择 Parakeet Flash(约 250 MB)获得仅英语的最低延迟
  • 在文本编辑器中测试全局热键,验证 Smart Typing 插入和实时浮层行为
  • 如需查看历史记录,可选启用 Audio History(本地录音,支持 ZIP 导出)

部署须知:硬件、存储与许可

所有高级模型(Nemotron、Parakeet、Cohere)均要求 Apple Silicon。Intel Mac 用户仅可使用 Apple Speech(内置,零下载)和 Whisper 变体(约 75 MB 至 2.9 GB)。Cohere Transcribe 是体积最大的模型(约 1.4 GB),支持 14 种语言,包括中文普通话、日语、韩语、越南语和阿拉伯语。

核心应用采用 GPLv3 许可证,意味着衍生作品也必须采用 GPLv3 并包含源代码。Fluid Intelligence——本地 AI 增强运行时——是专有的,不包含在开源版本中。开发者明确表示这种分离是为了可持续地免费提供核心听写体验。

应用内置自动更新功能,提供可选的 Beta 渠道以获取早期预览版本。应用以菜单栏工具形式运行,无需 Dock 图标。

谁适合关注

适合关注

  • 使用 Apple Silicon Mac 的写作人员、开发者和知识工作者,希望获得无需订阅的快速离线听写
  • 处于隐私敏感或受监管环境(法律、医疗、金融)的用户,不能将音频发送到云端
  • 需要根据任务在英语优化模型和多语言模型之间切换的多语言用户
  • 受益于 Command Mode 语音驱动 macOS 控制的无障碍用户
  • 正在评估 Superwhisper 或 Dragon 等付费听写订阅替代方案的人

可以先跳过

  • Windows 和 Linux 用户——FluidVoice 仅支持 macOS,iOS 和 Windows 列为 GitHub Sponsors 上的未来平台目标
  • 需要最快 Parakeet 或 Nemotron 模型的 Intel Mac 用户——仅 Apple Speech 和 Whisper 可用
  • 要求全栈开源(包括 AI 增强层)的团队——Fluid Intelligence 是专有的
  • 需要服务端或批量音频文件转写的用户——FluidVoice 是实时听写工具,非批处理器

风险与注意事项

核心听写应用为 GPLv3 且功能完整,但 Fluid Intelligence 为闭源,且项目依赖独立开发者进行模型集成更新。

  • Fluid Intelligence——差异化的 AI 增强层——由私有维护,不属于 GPLv3 源代码,对维护者的持续开发形成依赖
  • 所有高级语音模型(Nemotron、Parakeet、Cohere)均要求 Apple Silicon,排除了相当比例的 macOS 用户群
  • Parakeet Flash 标记为 Beta,表明最低延迟的英语模型可能仍存在稳定性问题
  • 项目似乎由独立开发者(altic-dev)维护,模型兼容性更新和 macOS 版本支持的 bus-factor 风险集中
  • GPLv3 copyleft 条款可能与禁止安装 copyleft 许可软件的组织策略冲突
  • 语音音频和转写文本除非你主动选择云端 AI 服务商(OpenAI、Groq 或自定义端点),否则不会离开设备
  • Fluid Intelligence 完全在本地运行——无需 API 密钥、无云端调用、AI 后处理无网络数据传输
  • Audio History 为可选启用,本地存储并支持 ZIP 导出——不使用云端存储
  • 分析和 Beta 版本根据功能列表明确为可选启用
  • Smart Typing 使用 macOS 辅助功能 API 进行文本插入,需授予辅助功能权限,但避免了可能向剪贴板管理器泄露数据的基于剪贴板的注入

替代方案比较

方案适用场景代价
whisper.cpp
你想要一个轻量级、跨平台的 C/C++ Whisper 实现,用于批量或实时转写,追求最大可移植性免费,MIT 许可证
Superwhisper
你想要一个精致的商业 macOS 听写应用,使用 Whisper 后端和云端处理,无需自行管理模型选择订阅制
Apple Voice Control
你需要 macOS 内置的语音控制和听写功能,零安装,接受 Apple 的设备端处理模型免费,macOS 内置
MacWhisper
你想要一个 macOS GUI Whisper 客户端进行文件转写,不需要 Command Mode 或全局热键听写免费增值

这个趋势说明了什么

在受监管行业中替代付费听写订阅

目前按月付费使用云端听写的法律、医疗和金融专业人士可以切换到 FluidVoice 的完全本地管道,同时消除订阅成本和数据外泄风险。Fluid Intelligence 的设备端格式化和大写处理直接替代了云端 AI 后处理。

在受监管团队中与 3-5 名用户进行两周试点,使用相同的听写样本对比当前付费工具的转写准确率和格式化质量。

面向无障碍工作流的语音驱动 macOS 自动化

Command Mode 支持通过语音启动应用、运行快捷指令和触发系统操作。这为以无障碍为核心的部署开辟了路径,满足用户在文本输入之外实现免手操作 Mac 控制的需求。

梳理目标用户每天执行的前 10 项 macOS 操作,将它们配置为快捷指令,并通过 Command Mode 测试语音触发执行。

面向国际化团队的多语言模型切换

Parakeet TDT v3 覆盖 25 种欧洲语言,Cohere Transcribe 增加了中文普通话、日语、韩语、越南语和阿拉伯语,Nemotron 支持约 40 种语言,FluidVoice 可以服务需要多语言听写的团队,无需维护多套工具。

安装两个互补模型(如 Parakeet TDT v3 覆盖欧洲语言、Cohere Transcribe 覆盖亚洲语言),测量切换时间和 5 个混合语言听写样本的准确率。

下一步建议

安装 FluidVoice,用 Parakeet TDT v3 与当前听写工具做对比测试

评估 FluidVoice 最快的方式是通过 Homebrew 安装,下载默认的 Parakeet TDT v3 模型(约 500 MB),运行 5 分钟听写测试,对比延迟和准确率与你当前使用的工具。

  1. 在 Apple Silicon Mac 上运行 `brew install --cask fluidvoice`
  2. 完成引导:授予辅助功能和麦克风权限,选择 Parakeet TDT v3 作为语音模型
  3. 使用全局热键以你的主要工作语言听写一段 500 字的文本
  4. 启用 Fluid Intelligence 并重新听写同一段文本,对比格式化和大写质量
  5. 测试 Command Mode:通过语音启动 3 个应用并运行 1 个快捷指令

RepoDaily 判断

FluidVoice 在 macOS 上提供了真正本地优先的听写体验,其模型选择广度目前在免费工具中无出其右。GPLv3 核心透明可审计;Fluid Intelligence 增加了专有的设备端 AI 增强,可替代云端后处理。主要限制是高级模型仅支持 Apple Silicon,以及持续模型和 macOS 兼容性更新依赖独立开发者。

信息来源