<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>鸡尾酒会问题 &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/%e9%b8%a1%e5%b0%be%e9%85%92%e4%bc%9a%e9%97%ae%e9%a2%98/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Tue, 29 Sep 2026 15:48:06 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>小米开源语音模型：多人同时说话，只转录你的声音</title>
		<link>https://mylogs.cn/%e5%b0%8f%e7%b1%b3%e5%bc%80%e6%ba%90%e8%af%ad%e9%9f%b3%e6%a8%a1%e5%9e%8b%ef%bc%9a%e5%a4%9a%e4%ba%ba%e5%90%8c%e6%97%b6%e8%af%b4%e8%af%9d%ef%bc%8c%e5%8f%aa%e8%bd%ac%e5%bd%95%e4%bd%a0%e7%9a%84%e5%a3%b0/</link>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Fri, 11 Sep 2026 08:13:34 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI开源]]></category>
		<category><![CDATA[声纹识别]]></category>
		<category><![CDATA[大模型]]></category>
		<category><![CDATA[小米]]></category>
		<category><![CDATA[开源模型]]></category>
		<category><![CDATA[语音识别]]></category>
		<category><![CDATA[鸡尾酒会问题]]></category>
		<guid isPermaLink="false">https://mylogs.cn/%e5%b0%8f%e7%b1%b3%e5%bc%80%e6%ba%90%e8%af%ad%e9%9f%b3%e6%a8%a1%e5%9e%8b%ef%bc%9a%e5%a4%9a%e4%ba%ba%e5%90%8c%e6%97%b6%e8%af%b4%e8%af%9d%ef%bc%8c%e5%8f%aa%e8%bd%ac%e5%bd%95%e4%bd%a0%e7%9a%84%e5%a3%b0/</guid>

					<description><![CDATA[9 月 11 日，小米技术官方宣布，正式发布并开源工业级目标说话人语音识别大模型 Xiaomi-Cocktai [&#8230;]]]></description>
										<content:encoded><![CDATA[<p class="wp-block-paragraph">9 月 11 日，小米技术官方宣布，正式发布并开源工业级目标说话人语音识别<a href="https://mylogs.cn/chatgpt-pro-%e9%87%8d%e5%bc%80-200-%e7%be%8e%e5%85%83%e6%a1%a3%ef%bc%9aapi-%e4%bb%b7%e5%80%bc%e8%bf%91%e7%bf%bb%e5%80%8d/">大模型</a> Xiaomi-CocktailASR-1。这款模型瞄准的是语音识别领域一个存在了几十年的老问题——&#8221;鸡尾酒会难题&#8221;。</p>
<h2 class="wp-block-heading">一个人说得清，几个人就抓瞎</h2>
<p class="wp-block-paragraph">所谓鸡尾酒会难题，指的是这样一种情况：现有的语音识别技术已经能以较高精度识别一个人说的话，可一旦说话人数变成两人甚至多人、声音彼此重叠，识别率就会出现断崖式下跌。</p>
<p class="wp-block-paragraph">人类在嘈杂的饭局上能自动锁定对面朋友的声音，把周围噪音当成背景过滤掉，机器长期以来却很难做到这一点。会议纪要、车载语音、多人访谈这类场景，恰恰全是多人同时开口的场合。</p>
<p class="wp-block-paragraph">Xiaomi-CocktailASR-1 的做法是把问题直接换了个解法。模型采用端到端的 LLM 架构，不再走&#8221;先分离声音、再识别内容&#8221;的两段式老路，而是把目标说话人的一段参考音频作为声纹提示丢给模型，让它在多人重叠的语音流里，精准提取并只转录这个人的话。</p>
<p class="wp-block-paragraph">换句话说，只要先给模型听一段&#8221;要听谁&#8221;的样本，它就能在混乱的音频中锁定这个人，其余人的声音被自动过滤。</p>
<h2 class="wp-block-heading">多个主流测试集达到最优，单人场景也不掉队</h2>
<p class="wp-block-paragraph">小米方面表示，该模型基于大规模多说话人数据训练，在 AliMeeting、AMI、LibriMix 等多个主流多说话人测试集上均达到最优性能，大幅领先现有方案。</p>
<p class="wp-block-paragraph">更关键的一点是它不需要两套系统。Xiaomi-CocktailASR-1 在单说话人场景下的识别表现，可以与主流单人语音识别模型相媲美。这意味着同一个模型既能应付多人混说，也能无缝处理单人说话，不必在不同模型之间来回切换。</p>
<h2 class="wp-block-heading">目标不在场，就输出空文本</h2>
<p class="wp-block-paragraph">在实际落地中，误触发往往比识别不准更让人头疼。会议室里旁边有人随口一句，语音助手就自作主张开始记录，这类问题在车载和智能音箱场景里尤其常见。</p>
<p class="wp-block-paragraph">Xiaomi-CocktailASR-1 具备负样本拒识能力：当音频中并不存在目标说话人时，模型会输出空文本，而不是硬凑一句识别结果出来。这一设计能显著降低非目标语音带来的误识别和误触发风险。</p>
<p class="wp-block-paragraph">此外，该模型还支持思维链推理模式，能够为识别结果提供具备可解释性的推理过程。对于需要调试语音系统、或者需要判断识别结果是否可信的场景，这项能力比单纯输出一串文字更有价值。</p>
<h2 class="wp-block-heading">权重和推理代码一并开源</h2>
<p class="wp-block-paragraph">目前，Xiaomi-CocktailASR-1 的模型权重与推理代码已经开放，托管在 GitHub 与 Hugging Face 两个平台上。</p>
<p class="wp-block-paragraph">对国内开发者而言，&#8221;工业级&#8221;&#8221;目标说话人&#8221;&#8221;多说话人最优&#8221;这几个标签叠在一起还直接开源，意味着语音交互、会议记录、助听设备、车载座舱等方向的团队，可以跳过从零训练的成本，直接在现有产品里试用。</p>
<p class="wp-block-paragraph">多人同时说话时只听一个人的声音，这件事听上去简单，做起来极难。小米这次不仅做出来了，还把它交到了所有开发者手里。</p>]]></content:encoded>
					
		
		
			</item>
	</channel>
</rss>
