聊天窗口用完即关,角色始终缺乏“存在感”。
透明桌面宠物
CEF 离屏渲染结合 Win32 透明窗口,角色常驻桌面:拖动、右键对话、托盘管理、舞台尺寸和待机动作都可设置。
不是堆砌参数,而是回答六个具体问题:桌面陪伴到底难在哪,这个项目又如何解决。
聊天窗口用完即关,角色始终缺乏“存在感”。
CEF 离屏渲染结合 Win32 透明窗口,角色常驻桌面:拖动、右键对话、托盘管理、舞台尺寸和待机动作都可设置。
语音助手“说完就忘”,每次对话都从零开始。
角色人格、当前历史与长期记忆共同参与上下文,回复流式逐步呈现,兼容 OpenAI 风格接口。
语音问答像对讲机:说完等待、听完再答,节奏割裂。
流式 ASR、按句 TTS 与自动对话模式协同工作,端到端延迟 800ms,实际速度随网络和模型服务波动。
平面头像和文字气泡,撑不起角色的情感表达。
Three.js 与 three-vrm 驱动模型、表情、口型和 11 个内置 VRMA 动作,也支持切换自己的 VRM。
合成声音千篇一律,换角色像换皮。
角色设定可手写或辅助生成,每个角色可选 CosyVoice 或 Qwen3-TTS 声音链路;无声音配置也能文字对话。
云端陪伴产品把对话、记忆和偏好全部收走。
角色、配置、历史和记忆默认保存在本机;使用云端 LLM、ASR 或 TTS 时,只发送完成对应能力所需的数据。
从说出口到角色回应,五个阶段自动衔接、部分并行。下面是这条链路的简化演示。
按住说话或右键桌宠,声音以 PCM 流实时送出。
在主窗口里管理角色、模型、设置和文字消息;收起主窗口后,桌宠继续留在桌面并承接语音对话。
角色切换、文字与语音聊天、历史、长期记忆、VRM 上传和服务设置。
透明悬浮、右键对话、模型与动作同步、宽高独立调整,不占用任务栏。
主窗口关闭后继续运行,可恢复主窗口、打开或关闭桌宠,以及完整退出应用。
安装后通过图形化向导填写 LLM 与 DashScope 配置,之后也能在设置页修改。
不需要专门打开一个应用。她就在桌面上,在工作的间隙、闲聊的瞬间和深夜的托盘里。
开机后角色回到桌面角落,伸个懒腰进入待机,不抢占注意力。
右键桌宠直接开口,流式识别说完即回,还记得你昨天提过的事。
在主窗口切换角色、声音或 VRM 模型,桌宠舞台立即同步。
主窗口收进托盘,角色进入 Sleepy 待机,服务仍在后台安静运行。
本地优先不等于假装离线。数据边界直接画出来:云端能力只发送完成对应功能所需的内容。
不配置云端服务时,仍可正常管理角色、浏览历史与调整设置,仅 AI 相关能力暂停。
以下描述以当前项目实际实现为准:它是单机单用户桌面应用,不是多人在线平台,也不承诺所有能力完全离线。
支持 OpenAI 兼容 LLM 接口,流式展示回复;角色设定可手写、由 LLM 生成,或用百科资料辅助生成。
浏览器采集 PCM 音频,经本地 WebSocket 转发到 DashScope ASR。自动对话模式负责监听、识别、回复和重新监听。
支持 CosyVoice 与 Qwen3-TTS 两条角色级声音链路。TTS 按句排队播放,并用音频幅度驱动模型口型。
Three.js、three-vrm 和 three-vrm-animation 驱动模型。当前包含 Idle、LookAround、Relax、Sleepy 等 11 个 VRMA 文件。
CEF OSR 将页面渲染到 Win32 分层窗口,支持透明背景、托盘管理、右键对话、模型同步和独立宽高设置。
对话历史保存在本机;长期记忆通过摘要生成并在后续对话中注入。用户可以查看、生成或清空相关数据。
WinForms + WebView2 承载 Vue 前端,并管理本地 FastAPI 服务、单实例、系统托盘、窗口生命周期和设置后重启。
配置、角色、历史和参考音频默认留在本机;使用第三方 LLM、ASR、TTS 或 OSS 时,对应请求会发送到所配置的服务。
仅支持 Windows x64;安装包尚未进行 Authenticode 签名;云端能力受网络、额度和第三方模型行为影响。
这里的“现有方案”指常见产品形态,不针对具体品牌。不同工具各有优势,虚拟陪伴更关注桌面存在感与角色状态连续性。
| 体验维度 | 常规 AI 聊天应用 | 3D 模型展示 / VTuber 工具 | 虚拟陪伴 |
|---|---|---|---|
| 核心目标 | 高效文字或语音问答 | 模型展示、直播驱动与创作 | 持续的角色陪伴与桌面交互 |
| 角色一致性 | 通常以提示词或会话为主 | 外观强,但对话人格往往依赖外部工具 | 人格、历史、记忆、声音与 VRM 在同一应用链路中 |
| 语音闭环 | 通常有语音输入或朗读 | 侧重实时捕捉,AI 对话需额外拼装 | ASR → LLM → 分句 TTS → 口型与动作自动串联 |
| 桌面存在 | 主要停留在应用窗口 | 可以悬浮,但多面向录制或直播 | 透明桌宠独立运行,主窗口收进托盘后仍可继续对话 |
| 情感表现 | 以文本、语调或头像为主 | 依赖操作者或捕捉设备驱动 | 回复句子自动映射表情、动作与音频口型 |
| 数据方式 | 多以云端账户和服务为中心 | 模型与工程文件通常本地保存 | 角色、历史、记忆与配置本地保存;云端能力按配置调用 |
| 部署与改造 | 开箱即用,但内部链路较封闭 | 扩展强,但整合成本较高 | 单机开箱体验与可读本地 API 并存,适合继续开发 |
文字、语音、模型、记忆与桌宠不需要在多个工具之间切换,角色状态也不必手工搬运。
前端在句子生成时并行安排 TTS,并在完整回复后修正情感动作,兼顾即时反馈和整体准确度。
系统托盘保留服务和桌宠,使用者可以回到原本工作,不必持续盯着聊天界面。
本地数据与第三方 API 职责分开说明;应用不会把“本地优先”包装成完全离线。