<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>ASR &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/asr/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Tue, 04 Aug 2026 09:31:22 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>语音识别终于能听懂你在说什么了</title>
		<link>https://mylogs.cn/tencent-hunyuan-asr30-preview/</link>
					<comments>https://mylogs.cn/tencent-hunyuan-asr30-preview/#respond</comments>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Tue, 04 Aug 2026 09:29:02 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI大模型]]></category>
		<category><![CDATA[AI模型]]></category>
		<category><![CDATA[ASR]]></category>
		<category><![CDATA[人工智能]]></category>
		<category><![CDATA[腾讯混元]]></category>
		<category><![CDATA[语音识别]]></category>
		<guid isPermaLink="false">https://mylogs.cn/tencent-hunyuan-asr30-preview/</guid>

					<description><![CDATA[你用语音输入法的时候，有没有被同音词坑过？&#8221;期中考试&#8221;打成&#8221;期终考试&#8 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">你用语音输入法的时候，有没有被同音词坑过？&#8221;期中考试&#8221;打成&#8221;期终考试&#8221;，&#8221;致癌物质&#8221;变&#8221;治癌物质&#8221;——机器听清了每个字，但就是不懂你的意思。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a752ef0be76b&quot;}" data-wp-interactive="core/image" data-wp-key="6a752ef0be76b" class="wp-block-image size-large aligncenter wp-lightbox-container"><img fetchpriority="high" decoding="async" width="642" height="364" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/hunyuan_header.webp" alt="语音识别终于能听懂你在说什么了" class="wp-image-3514" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/hunyuan_header.webp 642w, https://mylogs.cn/wp-content/uploads/2026/08/hunyuan_header-300x170.webp 300w" sizes="(max-width: 642px) 100vw, 642px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：腾讯新闻</figcaption></figure>





<p class="wp-block-paragraph">8 月 4 日，腾讯混元发布了新一代语音识别模型 Hy ASR 3.0 preview，核心升级就一句话：**从&#8221;逐字转写&#8221;变成&#8221;理解语境&#8221;。**</p>



<p class="wp-block-paragraph">具体数据很能打。在开源评测集上，中文普通话词错误率（WER）3.34%、英语 2.62%、粤语 3.12%，全部压在 3% 左右——这个水平已经接近人类速记员的准确率。</p>



<p class="wp-block-paragraph">但比数字更重要的，是它解决的三个实际痛点：</p>



<p class="wp-block-paragraph">**第一，同音词不再靠猜。** 以前语音识别是纯声学信号处理，听到什么写什么。Hy ASR 3.0 接入了混元大模型 Hy3 的语义理解能力，能根据上下文自动纠错。会议纪要、访谈转写这种长音频场景，越往后转越准。</p>



<p class="wp-block-paragraph">**第二，方言覆盖面广。** 支持 10 大方言片区、20 余个二级小片区。粤语、吴语、闽南语这些主流方言都能用，不用再刻意说&#8221;播音腔普通话&#8221;。</p>



<p class="wp-block-paragraph">**第三，复杂环境稳得住。** 高噪声环境、耳语、悄悄话这些声学条件恶劣的场景做了专项优化。工厂车间、街头、会议室都能用。</p>



<p class="wp-block-paragraph">技术架构上也有干货：采用 MoE（混合专家）架构，自研无监督语音编码器用了数千万小时级语音数据训练，还引入多阶段强化学习优化复杂场景的识别准确率。</p>



<p class="wp-block-paragraph">目前该模型已上线腾讯云 API，腾讯元宝 App 已首发接入并免费开放方言识别和上下文纠错功能。</p>



<p class="wp-block-paragraph">说白了，语音识别的竞争已经从&#8221;听得多准&#8221;升级到&#8221;懂你说什么&#8221;。对普通用户来说，最直接的感受就是：以后按住说话键，可以更随意、更自然地表达，不用担心机器把意思搞反了。</p>



<p class="wp-block-paragraph">你平时用语音输入多吗？最常遇到的识别错误是什么？</p>

]]></content:encoded>
					
					<wfw:commentRss>https://mylogs.cn/tencent-hunyuan-asr30-preview/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
	</channel>
</rss>
