家里的网络摄像头能录下画面,但真正想知道「刚才发生了什么」,还得自己一帧一帧翻看。常见的智能摄像头只认得出「人、车、宠物」这几类目标,遇到包裹、动作、异常行为就抓瞎。

开源社区给出了一套进阶方案:LLM Vision。这是一款免费开源的 Home Assistant 集成组件,可以调用大模型直接「看懂」监控画面,并用自然语言描述画面里正在发生什么。它不取代 Frigate 这类物体识别系统,而是建立在其之上 —— 当 Frigate 告诉你「门口检测到一个人」时,LLM Vision 还能补一句「快递员手里拿着包裹,把包裹放在了花盆后面」。
关键能力:自定义提问
LLM Vision 的一大特点是不依赖预设提示词。每次向它传入一张图片或一段视频时,都可以同时送入一段自定义提问,从而针对性地获取想要的上下文。
典型场景包括:门口检测到人 + 包裹时,询问「快递员是把包裹放下了,还是带走了?放在哪里了?」,并据此推送通知:「快递员将包裹放在了前门花盆后面」。这种基于上下文的判断,是普通物体识别做不到的。
更复杂的自动化可以因此成立。比如门铃摄像头检测到有人来,可以要求大模型判断对方是否「拿着传单又离开了」,如果是传单派送,则无需推送通知。再比如垃圾回收日前一晚,可以要求模型检查「垃圾桶是否已摆到门口?是蓝色回收桶还是黑色垃圾桶?」,由此判定是否需要提醒用户补摆或换桶。
接入路径与隐私权衡
LLM Vision 本身不做 AI 推理,调用方需要将画面发送给所选 AI 服务。它兼容 OpenAI、Anthropic、Google、OpenRouter、Groq 等多种供应商,其中 Groq 提供一定额度的免费调用。
云端调用意味着家中内外的监控画面会被上传到第三方服务器,隐私敏感的用户难以接受。对此,LLM Vision 也支持本地大模型方案:可以接入 Ollama、Open WebUI 或 LocalAI 等本地推理平台,所有画面分析都在自有硬件上完成,不出家门。
本地方案的效果取决于所选模型与硬件配置。低配设备也不必担心,Glimpse-v1 是新发布的轻量级开源视觉语言模型,参数量 40 亿,可在 Ollama 中以低显存运行,专为受限硬件优化。
落地位置与设备要求
LLM Vision 可处理静态图像、视频片段、实时摄像头流,以及 Frigate 事件。需要的环境是已经部署好的 Home Assistant 智能家居平台,并配合 Frigate 等负责视频存储与物体识别的组件。它还提供了「时间线卡片」(Timeline Card),可用于仪表盘展示最近被模型识别并记住的事件,比如「上次看到家里的猫是几点」「包裹是几点送到门口的」。
来源:How-To Geek







