Skip to content

Latest commit

 

History

11 Commits

Folders and files

NameName
Last commit message
Last commit date
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

谛明 Deeming

谛明 Deeming

谛听所思,明达所向。Deem Your Thoughts, Drive Your Way.

面向 Windows 的本地优先语音输入工具:按住说话,松开输入。

为什么选择谛明

  • 本地识别:FireRedASR2 和 Streaming Paraformer 均在本机运行;安装模型后,无需联网即可完成语音识别。
  • 隐私可控:不包含遥测,不会自动上传录音、识别文本或本地日志。网络仅用于用户主动下载模型或显式启用的第三方 LLM。
  • 按住即说:默认长按 CapsLock 超过 300 ms 开始录音,松开后识别;短按仍正常切换大小写状态。
  • 安全投递:录音开始时绑定窗口和输入位置,输出前再次校验;焦点改变时取消投递,避免文本误入其他窗口。
  • 按需增强:可选择 FireRed VAD、本地 CT-Transformer 标点,以及第三方 LLM 纠错、润色和有界上下文感应。
  • 原生轻量:使用 C++ 与 Win32 实现,无需 Electron 或浏览器内核,兼容 Windows 7 及以上 x64 系统。
  • 模型管理:内置下载器支持断点续传、SHA-256 校验和原子安装;模型按需下载,不捆绑在安装包中。

工作流程

  1. 绑定输入位置:按下录音快捷键时记录当前窗口、原生焦点和必要的输入位置身份。
  2. 聆听中:后台采集音频,并按配置执行本地 VAD 或流式 ASR;录音期间不会注入中间结果。
  3. 识别中:松开快捷键后停止采集,完成本地识别和可选的首尾静音裁剪。
  4. 润色中:只有显式选择 LLM 输出处理时,才会向用户配置的第三方 Provider 发送请求。
  5. 投递结果:重新验证会话、窗口和输入焦点,验证通过后才把文本送回原输入位置。

系统要求

  • Windows 7 或更高版本,x64。
  • 可用的麦克风输入设备。
  • 安装程序需要管理员权限,默认安装到 64 位 Program Files\Deeming
  • 安装包约 6.9 MiB,不包含 ASR、VAD 或标点模型;准备完整模型组合时建议预留约 6 GB 可用磁盘空间。
  • 首次下载模型需要网络连接;模型安装完成后,本地语音识别可以离线使用。
  • 第三方 LLM 文本处理需要用户自行准备服务地址、模型和 API Key,并可能产生第三方费用。

安装与首次使用

  1. 下载并校验 Deeming-Setup-v2.0.0-x64.exe
  2. 运行安装程序,阅读安全与隐私说明及软件最终用户许可协议;接受协议后选择安装目录。
  3. 首次启动时选择模型保存目录。模型目录必须位于程序安装目录之外。
  4. 右键托盘图标打开“设置”,在“模型管理”页下载所需模型。
  5. 在“语音识别”页选择 ASR 模型、VAD 和输出处理方式,然后点击“保存”。
  6. 在任意可输入窗口按住快捷键说话,松开后等待 HUD 完成识别和可选润色。

推荐组合

使用场景 ASR VAD 输出处理
日常离线输入 FireRedASR2 CTC int8 FireRed VAD 本地标点或保持原文
优先识别准确率 FireRedASR2 AED int8 FireRed VAD 本地标点或保持原文
边说边识别 Streaming Paraformer bilingual zh-en 按需启用 本地标点或保持原文
智能纠错与润色 任一已安装 ASR 建议启用 大模型润色,可选上下文感应

更详细的参数选择见谛明最优配置指南

设置页面

页面 内容
常规设置 录制快捷键
语音识别 模型根目录、识别模型、输出处理、VAD 和线程等高级设置
模型管理 模型选择、下载目录、进度、速度、阶段详情与取消操作
智能润色 Provider、API 地址、API Key、模型、连接测试、审计日志和上下文感应
提示指令 基础修复、深度修复、润色、感应修饰及自定义系统提示词
关于谛明 产品详情、版本号、版权信息和功能特性

本地模型

模型 用途 主要文件
FireRedASR2 CTC 日常本地离线 ASR model.int8.onnxtokens.txt
FireRedASR2 AED 本地离线 ASR encoder.int8.onnxdecoder.int8.onnxtokens.txt
Streaming Paraformer 本地流式 ASR encoder.int8.onnxdecoder.int8.onnxtokens.txt
CT-Transformer 本地自动标点 model.int8.onnx
FireRed VAD 人声检测 fireredvad_stream_vad_with_cache.onnx

LLM 与上下文

LLM 纠错默认不启用。启用时,在“智能润色”页配置 Provider、API 地址、API Key 和模型,再到“语音识别”页把输出处理设为“大模型润色”。内置 Provider 包含 OpenRouter、Mistral 和 Gemini,也可以配置兼容服务地址。

上下文感应同样需要用户显式开启。程序只读取热键按下时绑定窗口内的有界文本,拒绝密码控件;输入位置无法验证时不会提交相应上下文,目标发生变化时取消结果投递。

完整 LLM 审计日志默认关闭。只有显式开启后,程序才会在本地记录有界上下文、口述文本、最终消息和请求正文;日志不记录 Authorization 或 API Key,但仍可能包含敏感信息。

配置与本地数据

  • 配置:%APPDATA%\Deeming\config.json
  • LLM 审计日志:%APPDATA%\Deeming\log\llm_refine_YYYYMMDD.log
  • 模型:首次启动时由用户选择的外部目录

升级与卸载

安装新版本前先退出正在运行的谛明,再运行新版安装程序。安装程序使用固定产品标识,可以在现有安装上升级。

可以通过 Windows“程序和功能”卸载。卸载器默认保留 %APPDATA%\Deeming 中的配置和本地日志;交互式卸载时可勾选“同时删除当前用户的本地数据”。用户下载到自选目录的模型始终保留,需要时请在确认路径后手动删除。

已知边界

  • 最终文本在松开快捷键后投递。流式模型会在录音期间后台解码,但不会显示或注入中间结果。
  • 单次录音最多保留约 5 分钟 PCM。
  • 文本注入可能被更高权限的目标窗口拦截。
  • UI Automation 能力由目标应用提供;上下文不可验证时按无上下文路径处理。

安全、隐私与许可

谛明不包含遥测,也不提供收集个人隐私的在线服务。语音识别使用本地模型;网络仅用于用户主动下载模型,或用户自行配置并显式启用第三方 LLM 文本处理。完整边界见安全与隐私说明

安装或使用软件前请阅读软件最终用户许可协议。当前许可仅面向自然人最终用户的个人内部使用,不授权企业或机构部署、共享使用、再分发或对外提供服务。

第三方组件和模型仍由各自权利人所有并适用各自许可证,详见第三方软件与模型声明licenses 目录。

主要依赖

About

Windows 本地优先语音输入工具。按住快捷键说话,松开即可识别并安全输入到原位置;支持 FireRedASR2、Streaming Paraformer、本地 VAD/标点,以及可选的 LLM 润色与上下文感应。原生 C++/Win32,无遥测。

Topics

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

Used by

Contributors