<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>参数规模 &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/%e5%8f%82%e6%95%b0%e8%a7%84%e6%a8%a1/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Sat, 08 Aug 2026 05:51:57 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>字节跳动炼 10 万亿参数大模型，摸到了 Anthropic 门槛</title>
		<link>https://mylogs.cn/bytedance-10t-parameter-model/</link>
					<comments>https://mylogs.cn/bytedance-10t-parameter-model/#respond</comments>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Sat, 08 Aug 2026 05:51:40 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI训练]]></category>
		<category><![CDATA[Anthropic]]></category>
		<category><![CDATA[参数规模]]></category>
		<category><![CDATA[国产大模型]]></category>
		<category><![CDATA[大模型]]></category>
		<category><![CDATA[字节跳动]]></category>
		<category><![CDATA[混合专家]]></category>
		<guid isPermaLink="false">https://mylogs.cn/bytedance-10t-parameter-model/</guid>

					<description><![CDATA[中国 AI 公司的「军备竞赛」又往上跳了一级。英国《金融时报》8 月 7 日援引三位知情人士称，字节跳动正在训 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">中国 AI 公司的「军备竞赛」又往上跳了一级。英国《金融时报》8 月 7 日援引三位知情人士称，字节跳动正在训练一个最高可达 10 万亿参数的超大模型，规模逼近 Anthropic 最先进的 Mythos 系统。如果这个数字属实，它将成为中国企业训练过的最大模型，也把国内大模型的天花板直接抬到了美国前沿实验室的门口。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a76ef03a1803&quot;}" data-wp-interactive="core/image" data-wp-key="6a76ef03a1803" class="wp-block-image size-large aligncenter wp-lightbox-container"><img fetchpriority="high" decoding="async" width="1200" height="891" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/512706ec66dd8ede14ae39b1b07fb35b_header.webp" alt="字节跳动炼 10 万亿参数大模型，摸到了 Anthropic 门槛" class="wp-image-4066" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/512706ec66dd8ede14ae39b1b07fb35b_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/08/512706ec66dd8ede14ae39b1b07fb35b_header-300x223.webp 300w, https://mylogs.cn/wp-content/uploads/2026/08/512706ec66dd8ede14ae39b1b07fb35b_header-1024x760.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/08/512706ec66dd8ede14ae39b1b07fb35b_header-768x570.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：TechTimes</figcaption></figure>





<p class="wp-block-paragraph"><strong>比现有国产最大模型大三倍多</strong></p>



<p class="wp-block-paragraph">参数是衡量模型「体量」最直观的指标，指的是模型在训练中学到的那组数值，决定了它存储信息和记忆的上限。据《金融时报》报道，字节跳动这一模型目前处于预训练的早期阶段，这一阶段通常要持续三到六个月，之后如果顺利，才会进入微调和最终发布，确切规模要到更后期才能确定。</p>



<p class="wp-block-paragraph">横向一比就清楚了：月之暗面的 Kimi K3 是此前中国已发布的最大模型，参数为 2.8 万亿；阿里的 Qwen 3.8-Max 为 2.4 万亿；DeepSeek 的 V4-Pro 约 1.6 万亿。字节跳动这枚新模型最高可达 10 万亿，相当于 Kimi K3 的三倍多，把 Alibaba 和 DeepSeek 一并甩在身后。</p>



<p class="wp-block-paragraph">美国那边，Anthropic 从不公开自家模型的参数规模。业内普遍估计，其最先进的 Mythos 5 大约在 8 万亿参数上下，更广泛开放的 Fable 5 约 5 万亿。也就是说，若字节跳动真冲到 10 万亿，它在「体量」这一项上已经和美国最顶尖的系统处在同一区间。</p>



<p class="wp-block-paragraph"><strong>钱和人早就铺好了</strong></p>



<p class="wp-block-paragraph">能撑起这种量级的训练，靠的是真金白银。报道提到，字节跳动已将 2026 年的 AI 资本开支计划从去年初拟定的 1600 亿元人民币，上调到 2000 亿元以上（约 300 亿美元），其中大约一半用于采购芯片。</p>



<p class="wp-block-paragraph">带队的是内部的研究组织 Seed 团队，由前 Google DeepMind 科学家吴永辉领衔，目前在中外合计约 2000 人。在消费者端，字节跳动的豆包 AI 助手月活已达约 3.24 亿，是国内最大的 AI 应用；视频生成模型 Seedance 也被不少从业者视为当前全球表现最好的同类产品。从短视频起家的公司，已经把地基挖到了基础模型的深处。</p>



<p class="wp-block-paragraph">创始人张一鸣给团队定了一条有点「轴」的规矩：不要依赖「蒸馏」——也就是拿更强模型的输出去训练或改良自己的小模型——哪怕短期性能会因此吃亏。在他看来，抄近路会伤到长期的技术突破，宁可慢一点也要走自研。这也能解释为什么字节跳动至今坚持闭源路线，和阿里、DeepSeek 走开源的思路截然不同。</p>



<p class="wp-block-paragraph"><strong>但「10 万亿」不等于「比 Anthropic 强」</strong></p>



<p class="wp-block-paragraph">说白了，参数规模是最容易被误读的数字。字节跳动披露的是「总参数」，而决定模型实际能力的，还有架构、数据质量和训练方法。当前几乎所有前沿模型都采用混合专家（MoE）架构，推理时只激活一小部分参数：DeepSeek 的 V4-Pro 总参数 1.6 万亿，真正在每次推理时激活的只有约 490 亿，仅占总量的 3%。换句话说，10 万亿描述的是「要存多大」，而不是「有多聪明」。</p>



<p class="wp-block-paragraph">《金融时报》也明确点出，这枚模型尚未完成训练，更没有经过独立基准测试，现在就拿它和 Anthropic 比高下为时过早。但它释放的信号足够清晰：中国 AI 公司不再满足于做低成本、跟跑式的模型，而是开始正面冲击前沿。</p>



<p class="wp-block-paragraph">按三到六个月的预训练节奏推算，这枚模型最早也要到 2027 年初才可能公开亮相。在那之前，外界能做的只有一件事——等它练完，再看激活参数到底是多少。</p>



<p class="has-small-font-size wp-block-paragraph">来源：英国《金融时报》（FT）、路透社</p>

]]></content:encoded>
					
					<wfw:commentRss>https://mylogs.cn/bytedance-10t-parameter-model/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
	</channel>
</rss>
