火种说|他用 MiniCPM-o 4.5,做了一个能看屏幕、听声音的桌面“贾维斯”
上一期「火种说」,我们记录了一位开发者用 MiniCPM-o 4.5 打造的桌面陪伴机器人,核心是全双工交互带来的自然对话体验。而这一期的火种——林亦与项目协作者,同样基于 MiniCPM-o 4.5 的全双工能力,但把交互延伸到了“桌面全场景”。
打游戏时,它会提醒你背后有怪;上网课时,它会发现你正在走神;一天结束后,它甚至能告诉你今天学了多久、玩了多久、看了多久视频,以及中间发了多长时间的呆。这不是电影里的贾维斯,而是林亦团队在 NVIDIA 与抖音平台的联合创作合作中,基于 MiniCPM-o 4.5打造的一款本地全模态桌面 Agent——AI Jarvis。 01.从“只会截图问答” 到“持续在场” 林亦之前做过一个游戏陪玩 AI,方案是程序每隔几秒截取画面发给云端模型,再生成一句点评和提醒。看起来像是有人在旁边陪你打游戏,但问题很快暴露:慢和贵。从截屏、上传、等待云端模型处理到生成回复,存在明显延迟,等 AI 终于发现危险,游戏里的角色可能已经倒下了。其次,API 账单不断累积,旧版本累计消耗一度达到 861.69 美元。更关键的是,这个 AI 只能看到一张张割裂的截图,不知道前一秒发生了什么,也听不到游戏声音。 这一次,他把目光转向了 MiniCPM-o 4.5。在 AI Jarvis 中,模型大约每秒接收一帧桌面画面和最近一秒的系统音频,不断在两种状态间做选择: LISTEN——继续观察,不打扰用户。 SPEAK——根据当前画面和声音,输出一句有依据的提醒或点评。 它不再需要用户先问一句“刚才发生了什么”。它一直都在现场。 为了让持续感知与具体任务互不干扰,项目还分别维护了两套模型上下文:一套用于判断场景、游戏、课程和长期记忆;一套用于全双工交互,决定什么时候保持安静、什么时候开口。这种设计让 AI Jarvis 不只是“看到了什么就说什么”,而是能结合上下文判断眼下是否真的需要介入。 02.它会陪玩,也会做笔记 游戏陪伴是 AI Jarvis 最直观的应用。林亦首先在《我的世界》中进行了测试。当猪靠近时,AI 会提醒“小心别被撞”;玩家进入危险场景时,也会给出提示。但新的问题也随之出现:AI 有时过于积极,弹幕太多,不符合不同游戏的节奏。 于是,项目加入了“游戏陪伴方案”——用户可为不同游戏配置独立的提示词和互动方式,让 AI 理解规则、玩家需求和何时保持安静。在 CS 中,它输出低频简短的气泡提醒,避免遮挡画面;在《胡闹厨房》中,它根据关卡状态给出不同提醒。它不是外挂,也不会替用户操作,更像一个盯着屏幕的队友:偶尔提醒,偶尔吐槽,有时有用,有时嘴欠。这种不完全可预测的临场反应,反而让这个桌面角色有了一点“活人感”。 切换到课程模式,AI Jarvis 同时理解课程画面和教师声音。用户走神时,桌宠给出简短提醒;遇到重要知识点,它记录对应内容。课程结束后,它把关键画面、知识点和说明整理成 Markdown 笔记。不仅能转写音频,还能将板书、公式和课件画面一并保存,用户回顾时可直接定位到相关内容,无需从头回看。 03.从“当前画面” 到“这一天发生了什么” 如果 AI 一直在场,它能不能进一步理解用户的一整天?AI Jarvis 为此加入了本地记忆功能。它会从场景判断中整理活动时间线,记录用户什么时间学习、看视频、写代码等。一天结束后,可以生成一份带有时间线的回顾,甚至配置图像生成 API 后还能转化成一张“日程图”。 它还能发现用户在什么问题上停留了较长时间——写代码卡住时提醒一句,连续工作太久时建议用户休息一下。由此,AI Jarvis 从一个游戏陪伴助手,逐渐变成了一个持续理解用户工作、学习和娱乐状态的桌面 Agent。 04.一个始终看着屏幕的 AI 隐私怎么办? 让 AI 持续看屏幕、听声音,首先带来的不是技术问题,而是隐私问题。林亦专门回应了这一点:AI Jarvis 的日常屏幕感知、系统音频处理和核心模型推理都在本机完成。原始屏幕画面和音频主要用于即时推理,日常运行时不会被长期保存。本地记忆只记录整理后的活动时间线和场景结果。 课程模式会保存用户需要的关键画面、知识点和说明;只有在用户主动配置并调用图像生成 API 制作日程图时,相应的回顾内容才会被发送给用户选择的外部服务。 用户还可以双击桌宠,随时暂停或恢复屏幕与音频感知。暂停之后,模型无法继续获取当前画面与声音。 本地运行并不能自动解决所有隐私问题,但至少让数据是否离开设备、哪些内容被长期保存,以及什么时候停止感知,重新回到了用户手里。 05.让本地 AI 从“能运行”变成“能安装” 林亦和开发团队还将项目整理成了可供普通 Windows 用户直接安装的桌面应用——安装包已包含 Python 后端和编译好的 C++ 推理运行时,无需预装 Python、Git、CMake、Visual Studio 或 CUDA,第一次启动时自动下载并校验约 6.32 GiB 的 MiniCPM-o 4.5 GGUF 模型文件。本地推理基于 llama.cpp-omni,桌面画面通过 DXGI 采集,系统音频通过 WASAPI 获取;在支持的 NVIDIA 显卡上优先启用 CUDA 加速并根据显存自动分配层数,也可回退到 CPU 运行。当前版本以文字交互为主,游戏陪伴只负责观察、提示和互动,不会直接控制游戏,这些能力边界并没有削弱它的科幻感,反而让它从一个效果视频真正走向了可下载、可运行、可修改的开源作品。 让 AI Jarvis 项目得以实现的,是 MiniCPM-o 4.5 提供的两大能力:低延迟全双工交互,以及本地隐私保护。这两项能力让模型能边看、边听、边判断何时开口。同时,所有感知和推理都在本机完成,数据始终掌握在用户自己手里。基于这样的模型能力,林亦与团队搭建出了一个能持续感知桌面场景、主动陪伴、随时响应,且无需把数据传到云端的桌面 Agent。而 MiniCPM-o 4.5 的能力边界,远不止于此。我们相信,在更多开发者的手里,它会支撑起更多像 AI Jarvis 这样的新物种。模型从来不是终点,而是起点。下一个惊喜,可能就在你手中。




