家用监控摄像头能录下门内门外的画面,但大多数时候,还得自己一帧一帧翻录像才知道到底发生了什么。有些摄像头带物体识别,能认出人、车、宠物、包裹,可也就到此为止。

How-To Geek 撰稿人 Adam Davidson 分享,一个开源工具能让 AI 直接”看懂”画面,并用大白话描述出来。这个工具叫 LLM Vision,是一个免费开源的 Home Assistant 集成。它不替代 Frigate 这类本地录像与物体识别系统,而是叠加在上面:物体识别只告诉你”检测到一个人”,LLM Vision 则能进一步说清这个人在做什么、有没有拿包裹、往哪个方向走、穿着什么。它支持静态图片、视频片段、实时画面,也能直接分析 Frigate 事件。
一、在 Home Assistant 里安装
- 打开 HACS(Home Assistant 社区商店),搜索并下载 LLM Vision。
- 进入 设置 → 设备与服务 → 添加集成,搜索并选择 LLM Vision。
- 在 Provider(服务商)下拉菜单里选择要用的 AI,并填入对应的 API Key。
二、选对 AI 服务商:云端还是本地
- 云端可选 OpenAI、Anthropic、Google、OpenRouter、Groq 等;多数按次计费,其中 Groq 提供一定的免费额度。
- 注意隐私:用云端等于把家里的画面上传到第三方服务器。
- 想让画面不出家门,可指向本地模型——用 Ollama、Open WebUI 或 LocalAI 运行本地模型,分析全程在自家硬件完成。
- 硬件较弱也别灰心,可试试测试版的 Glimpse-v1:一个 40 亿参数的轻量开源视觉模型,专为小内存设计,能在 Ollama 里运行。
三、用自然语言提问,做更聪明的自动化
- 传图片或视频给 LLM Vision 时,可附上自己的提问,例如”快递员把包裹放哪了”,收到的通知就会是”快递员把包裹放在了前门花盆后面”。
- 自动化可以基于”语境”而非单纯的动作触发:比如有人拿着传单走到门口、又空手离开,就不推送通知,免得被垃圾广告打扰。
- 倒垃圾前一晚,可让它看看垃圾桶是否已摆到门口,甚至分辨是蓝色回收桶还是黑色垃圾桶。
- 仪表盘可添加 Timeline Card,回看最近被分析和记录的事件,例如上次猫出现的时间、包裹送达的时刻。
注意事项
- LLM Vision 本身不做 AI 运算,只负责把画面转交给所选模型,响应的质量与速度取决于模型和硬件。
- 在意隐私的家庭,优先选择本地模型方案,让画面始终留在家中。
来源:How-To Geek







