<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>抽帧 &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/%e6%8a%bd%e5%b8%a7/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Tue, 04 Aug 2026 01:19:49 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>让大模型看视频，选帧比选模型更重要</title>
		<link>https://mylogs.cn/%e8%ae%a9%e5%a4%a7%e6%a8%a1%e5%9e%8b%e7%9c%8b%e8%a7%86%e9%a2%91%ef%bc%8c%e9%80%89%e5%b8%a7%e6%af%94%e9%80%89%e6%a8%a1%e5%9e%8b%e6%9b%b4%e9%87%8d%e8%a6%81/</link>
					<comments>https://mylogs.cn/%e8%ae%a9%e5%a4%a7%e6%a8%a1%e5%9e%8b%e7%9c%8b%e8%a7%86%e9%a2%91%ef%bc%8c%e9%80%89%e5%b8%a7%e6%af%94%e9%80%89%e6%a8%a1%e5%9e%8b%e6%9b%b4%e9%87%8d%e8%a6%81/#respond</comments>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Tue, 04 Aug 2026 01:18:48 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI大模型]]></category>
		<category><![CDATA[AI工具]]></category>
		<category><![CDATA[多模态]]></category>
		<category><![CDATA[开源项目]]></category>
		<category><![CDATA[抽帧]]></category>
		<category><![CDATA[视频理解]]></category>
		<guid isPermaLink="false">https://mylogs.cn/?p=3469</guid>

					<description><![CDATA[你把一段视频丢给大模型，它其实并没在&#8221;看&#8221;视频——它看到的是从里面抽出来的一沓静态截图 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">你把一段视频丢给大模型，它其实并没在&#8221;看&#8221;视频——它看到的是从里面抽出来的一沓静态截图。开发者黄志弘在自己的工程笔记里给了个很直白的数字：受上下文预算所限，一段视频现实中最多只能塞进约 150 张图。抽哪 150 张，决定了模型是真看过，还是只看了一份关于它的幻灯片。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a728cdee632c&quot;}" data-wp-interactive="core/image" data-wp-key="6a728cdee632c" class="wp-block-image size-large aligncenter wp-lightbox-container"><img fetchpriority="high" decoding="async" width="1200" height="600" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/7c93e5a1b84d47f2a0c61d8e3f52b9a7_header.webp" alt="让大模型看视频，选帧比选模型更重要" class="wp-image-3474" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/7c93e5a1b84d47f2a0c61d8e3f52b9a7_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/7c93e5a1b84d47f2a0c61d8e3f52b9a7_header-300x150.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/7c93e5a1b84d47f2a0c61d8e3f52b9a7_header-1024x512.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/7c93e5a1b84d47f2a0c61d8e3f52b9a7_header-768x384.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：GitHub / claude-real-video 项目页</figcaption></figure>





<p class="wp-block-paragraph">他做的开源工具叫 claude-real-video，采用 MIT 许可、完全在本地运行。核心结论是：抽帧不该按秒数均匀采样。定时采样会同时犯两个错——把一堆几乎一样的人头特写塞满预算，又恰好跳过真正发生事情的那一秒。</p>



<p class="wp-block-paragraph">他的做法是让阈值自己浮动：先算出每一帧的画面变化分数，再跟滚动平均值比，高动态素材自动抬高门槛，安静素材自动降低，不用人调参。去重则拆成三条通道——全局通道用 16×16 的色彩指纹判断整体变化；动作通道改用 32×32 网格，只要少数格子剧烈变化就保留，专治&#8221;画面里的人只占半个百分点&#8221;这类小主体；第三条通道精度提到 192×192，专门抓字幕更换、白板上多出一行字这种局部微变。有意思的是，第二条通道不是测出来的，是一位用户跑了 2181 段真实视频之后反馈出来的。</p>



<p class="wp-block-paragraph">说白了，视频理解眼下卡的不是模型看不懂，而是给它看什么。这跟写提示词是同一件事：信息密度比信息总量重要。</p>



<p class="wp-block-paragraph">如果你在做视频相关的自动化，不妨先检查一下自己的抽帧逻辑，是不是还停在&#8221;每秒一帧&#8221;。</p>



<p class="wp-block-paragraph">来源：leoaido.com（作者黄志弘）</p>

]]></content:encoded>
					
					<wfw:commentRss>https://mylogs.cn/%e8%ae%a9%e5%a4%a7%e6%a8%a1%e5%9e%8b%e7%9c%8b%e8%a7%86%e9%a2%91%ef%bc%8c%e9%80%89%e5%b8%a7%e6%af%94%e9%80%89%e6%a8%a1%e5%9e%8b%e6%9b%b4%e9%87%8d%e8%a6%81/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
	</channel>
</rss>
