你把一段视频丢给大模型,它其实并没在”看”视频——它看到的是从里面抽出来的一沓静态截图。开发者黄志弘在自己的工程笔记里给了个很直白的数字:受上下文预算所限,一段视频现实中最多只能塞进约 150 张图。抽哪 150 张,决定了模型是真看过,还是只看了一份关于它的幻灯片。

他做的开源工具叫 claude-real-video,采用 MIT 许可、完全在本地运行。核心结论是:抽帧不该按秒数均匀采样。定时采样会同时犯两个错——把一堆几乎一样的人头特写塞满预算,又恰好跳过真正发生事情的那一秒。
他的做法是让阈值自己浮动:先算出每一帧的画面变化分数,再跟滚动平均值比,高动态素材自动抬高门槛,安静素材自动降低,不用人调参。去重则拆成三条通道——全局通道用 16×16 的色彩指纹判断整体变化;动作通道改用 32×32 网格,只要少数格子剧烈变化就保留,专治”画面里的人只占半个百分点”这类小主体;第三条通道精度提到 192×192,专门抓字幕更换、白板上多出一行字这种局部微变。有意思的是,第二条通道不是测出来的,是一位用户跑了 2181 段真实视频之后反馈出来的。
说白了,视频理解眼下卡的不是模型看不懂,而是给它看什么。这跟写提示词是同一件事:信息密度比信息总量重要。
如果你在做视频相关的自动化,不妨先检查一下自己的抽帧逻辑,是不是还停在”每秒一帧”。
来源:leoaido.com(作者黄志弘)







