dsh-earsDeepSeek Harness plugin

Voice input plugin for DeepSeek Harness (DSH) with text polishing. Supports local GPU Whisper and STT(ASR) API | 一款支持润色整理的 DeepSeek Harness 语音输入插件,为 DSH 提供语音输入能力,支持本地 GPU Whisper 和主流语音识别转写 API

Stars
15
Forks
4
License
MIT
Last commit
Aug 29, 2026
Latest release
v0.2.2

Overview

Voice input plugin for DeepSeek Harness (DSH) with text polishing. Supports local GPU Whisper and STT(ASR) API | 一款支持润色整理的 DeepSeek Harness 语音输入插件,为 DSH 提供语音输入能力,支持本地 GPU Whisper 和主流语音识别转写 API

Original README

Cached from the project repository on Sep 3, 2026. This is source content, separate from the Agents.md review above.

View source

dsh-ears

dsh-ears

一款支持润色整理的 DeepSeek Harness 语音输入插件。

简体中文 · English

dsh 0.1.0-rc.6 - 0.1.1-rc.2 npm version npm downloads MIT

https://github.com/user-attachments/assets/1363768e-a393-44bd-a008-1ce2055cac41


dsh-ears 为 DeepSeek Harness 提供语音输入与 LLM 润色整理能力。支持浏览器 Web Speech、本地 Whisper 以及主流语音识别(ASR)API 服务。

安装

前置依赖:DeepSeek Harness0.1.0-rc.60.1.1-rc.2)和 Node.js ^22.19.0 || >=24.0.0

通过 npm 安装

sh
dsh plugin --profile web add dsh-ears

从源码安装

sh
git clone https://github.com/WizisCool/dsh-ears.git
cd dsh-ears
pnpm use:platform
pnpm install
pnpm build
dsh plugin --profile web add "$PWD"
# Windows 的 cmd 请使用 "%CD%";PowerShell 直接使用 $PWD

pnpm use:platformnode_modules 切换到当前平台的 native 依赖树(Windows / Linux 各自独立),首次克隆和跨平台切换后都需要运行。

安装完成后刷新 Web UI,输入框右侧会显示麦克风图标。

更新

sh
dsh plugin --profile web add dsh-ears

add 会从 npm 拉取最新版本,任何已装版本都可以直接运行。更新后需要重启 dsh web 加载新的服务端代码,再刷新 Web UI;也可以在设置页的"关于"面板检查新版本。

卸载

sh
dsh plugin --profile web remove dsh-ears

卸载后刷新 Web UI。

使用

  1. 点击麦克风图标,或按下 Ctrl+Shift+Space(可在设置页更改)
  2. 开始说话
  3. 再次按下快捷键或点击麦克风,停止录音并开始转写
  4. 开启润色后,原始转写会先写入草稿,润色完成后再更新,期间的手动编辑会被保留
  5. 检查内容后手动发送

转写结果始终写入可编辑草稿,不会自动发送。如果所选后端尚未就绪,麦克风图标会变灰,悬停即可查看原因。

识别后端

后端工作方式需要什么
Web Speech浏览器实时识别默认后端;Chromium 内核浏览器
本地 Whisper录音结束后本地转写在设置页下载 GGML 模型
GroqGroq Whisper APIAPI key
Deepgram预录音频实时音频流API key、模型名(如 nova-3
阿里云百炼DashScope 同步转写API key、模型名;单次最长 300 秒
腾讯云录音文件识别实时语音识别AppID、SecretID、SecretKey、engine_type
小米 MiMo语音识别 API,支持标准 API 或 Token PlanAPI key、模型名(如 mimo-v2.5-asr);Token Plan 需选择区域集群
硅基流动 (CN)语音转写 APIAPI key、模型名(如 FunAudioLLM/SenseVoiceSmall
火山引擎录音文件识别(大模型)单向流式语音识别API key(新版控制台 X-Api-Key)、资源 ID
自定义 OpenAI 兼容发送到指定 /audio/transcriptions 端点端点地址、API key、模型名

本地 Whisper:基于 @fugood/whisper.node 本地运行 whisper.cpp,无需 Python、FFmpeg 或外部依赖。支持在设置页下载管理 GGML 模型(tiny(默认)至 turbo),并可选 default(自动)、vulkancuda 加速。

火山引擎:仅支持新版控制台的 API Key(X-Api-Key)鉴权(不支持旧版 AppID + Access Token),可在控制台 API Key 管理页面获取。

润色

默认开启。提供方和模型都留空时使用 dsh 的默认 Agent 模型(包括默认推理设置);也可以从 dsh 已配置的模型中选择。LLM 凭据复用 dsh 现有配置。支持设置推理强度。

默认提示词会删除口头禅、修正 ASR 错字、处理自我纠正和口头列举。可在设置页自定义提示词或查看默认内容。润色失败或取消时保留原始转写。

设置

安装后在 Web UI 的设置页出现 dsh-ears 面板,分为四个标签页:

标签页可配置项
常规设置页显示名称、语音快捷键开关与组合键、提示音开关、最长录音时间(1–600 秒,默认 120 秒)
识别后端选择、语言、本地 Whisper 模型和加速方式、云服务提供方及各提供方凭据
润色开关、LLM 提供方和模型、推理强度、自定义提示词(最长 4000 字)
关于版本号、许可证、dsh 兼容范围、检查更新

已知限制

  • Web Speech 后端依赖浏览器实现,音频可能被发送到浏览器厂商的服务端处理,不是完全的本地/离线方案。
  • 百炼单次录音最长 300 秒。
  • Deepgram Flux 系列模型需要 Listen V2 协议,当前不支持。
  • 本地 Whisper 单次音频限制 24 MB,转写超时 120 秒。
  • 加速方式(default / vulkan / cuda)在首次 native 加载后锁定,切换需重启 dsh web

本地开发

sh
pnpm use:platform
pnpm install
dsh plugin --profile web add "$PWD"
# Windows 的 cmd 请使用 "%CD%";PowerShell 直接使用 $PWD
pnpm check          # 类型检查
pnpm test           # 运行测试
pnpm build          # 构建
pnpm dev:config     # 构建并生成 HMR 配置
pnpm dev:web        # 启动 dsh web

开发时在另一个终端运行 pnpm dev:watch 实时重编译。

修改前端 UI 代码只需刷新浏览器;修改服务端、设置注册、Remote 或 schema 代码需重启 dsh web 再刷新。

文档

License

MIT

友链