<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>语音识别 &#8211; mylogs.cn</title>
	<atom:link href="https://mylogs.cn/tag/%E8%AF%AD%E9%9F%B3%E8%AF%86%E5%88%AB/feed/" rel="self" type="application/rss+xml" />
	<link>https://mylogs.cn</link>
	<description>发现、记录、分享</description>
	<lastBuildDate>Tue, 04 Aug 2026 09:31:22 +0000</lastBuildDate>
	<language>zh-Hans</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	
	<item>
		<title>语音识别终于能听懂你在说什么了</title>
		<link>https://mylogs.cn/tencent-hunyuan-asr30-preview/</link>
					<comments>https://mylogs.cn/tencent-hunyuan-asr30-preview/#respond</comments>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Tue, 04 Aug 2026 09:29:02 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI大模型]]></category>
		<category><![CDATA[AI模型]]></category>
		<category><![CDATA[ASR]]></category>
		<category><![CDATA[人工智能]]></category>
		<category><![CDATA[腾讯混元]]></category>
		<category><![CDATA[语音识别]]></category>
		<guid isPermaLink="false">https://mylogs.cn/tencent-hunyuan-asr30-preview/</guid>

					<description><![CDATA[你用语音输入法的时候，有没有被同音词坑过？&#8221;期中考试&#8221;打成&#8221;期终考试&#8 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">你用语音输入法的时候，有没有被同音词坑过？&#8221;期中考试&#8221;打成&#8221;期终考试&#8221;，&#8221;致癌物质&#8221;变&#8221;治癌物质&#8221;——机器听清了每个字，但就是不懂你的意思。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a74468c6731a&quot;}" data-wp-interactive="core/image" data-wp-key="6a74468c6731a" class="wp-block-image size-large aligncenter wp-lightbox-container"><img fetchpriority="high" decoding="async" width="642" height="364" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/08/hunyuan_header.webp" alt="语音识别终于能听懂你在说什么了" class="wp-image-3514" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/08/hunyuan_header.webp 642w, https://mylogs.cn/wp-content/uploads/2026/08/hunyuan_header-300x170.webp 300w" sizes="(max-width: 642px) 100vw, 642px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：腾讯新闻</figcaption></figure>





<p class="wp-block-paragraph">8 月 4 日，腾讯混元发布了新一代语音识别模型 Hy ASR 3.0 preview，核心升级就一句话：**从&#8221;逐字转写&#8221;变成&#8221;理解语境&#8221;。**</p>



<p class="wp-block-paragraph">具体数据很能打。在开源评测集上，中文普通话词错误率（WER）3.34%、英语 2.62%、粤语 3.12%，全部压在 3% 左右——这个水平已经接近人类速记员的准确率。</p>



<p class="wp-block-paragraph">但比数字更重要的，是它解决的三个实际痛点：</p>



<p class="wp-block-paragraph">**第一，同音词不再靠猜。** 以前语音识别是纯声学信号处理，听到什么写什么。Hy ASR 3.0 接入了混元大模型 Hy3 的语义理解能力，能根据上下文自动纠错。会议纪要、访谈转写这种长音频场景，越往后转越准。</p>



<p class="wp-block-paragraph">**第二，方言覆盖面广。** 支持 10 大方言片区、20 余个二级小片区。粤语、吴语、闽南语这些主流方言都能用，不用再刻意说&#8221;播音腔普通话&#8221;。</p>



<p class="wp-block-paragraph">**第三，复杂环境稳得住。** 高噪声环境、耳语、悄悄话这些声学条件恶劣的场景做了专项优化。工厂车间、街头、会议室都能用。</p>



<p class="wp-block-paragraph">技术架构上也有干货：采用 MoE（混合专家）架构，自研无监督语音编码器用了数千万小时级语音数据训练，还引入多阶段强化学习优化复杂场景的识别准确率。</p>



<p class="wp-block-paragraph">目前该模型已上线腾讯云 API，腾讯元宝 App 已首发接入并免费开放方言识别和上下文纠错功能。</p>



<p class="wp-block-paragraph">说白了，语音识别的竞争已经从&#8221;听得多准&#8221;升级到&#8221;懂你说什么&#8221;。对普通用户来说，最直接的感受就是：以后按住说话键，可以更随意、更自然地表达，不用担心机器把意思搞反了。</p>



<p class="wp-block-paragraph">你平时用语音输入多吗？最常遇到的识别错误是什么？</p>

]]></content:encoded>
					
					<wfw:commentRss>https://mylogs.cn/tencent-hunyuan-asr30-preview/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
		<item>
		<title>断网也能语音转文字：Mac开源神器用上千问模型</title>
		<link>https://mylogs.cn/%e6%96%ad%e7%bd%91%e4%b9%9f%e8%83%bd%e8%af%ad%e9%9f%b3%e8%bd%ac%e6%96%87%e5%ad%97%ef%bc%9amac%e5%bc%80%e6%ba%90%e7%a5%9e%e5%99%a8%e7%94%a8%e4%b8%8a%e5%8d%83%e9%97%ae%e6%a8%a1%e5%9e%8b/</link>
					<comments>https://mylogs.cn/%e6%96%ad%e7%bd%91%e4%b9%9f%e8%83%bd%e8%af%ad%e9%9f%b3%e8%bd%ac%e6%96%87%e5%ad%97%ef%bc%9amac%e5%bc%80%e6%ba%90%e7%a5%9e%e5%99%a8%e7%94%a8%e4%b8%8a%e5%8d%83%e9%97%ae%e6%a8%a1%e5%9e%8b/#respond</comments>
		
		<dc:creator><![CDATA[steve, zhang]]></dc:creator>
		<pubDate>Wed, 29 Jul 2026 19:02:02 +0000</pubDate>
				<category><![CDATA[科技]]></category>
		<category><![CDATA[AI工具]]></category>
		<category><![CDATA[Mac]]></category>
		<category><![CDATA[Qwen]]></category>
		<category><![CDATA[开源软件]]></category>
		<category><![CDATA[本地部署]]></category>
		<category><![CDATA[语音识别]]></category>
		<guid isPermaLink="false">https://mylogs.cn/%e6%96%ad%e7%bd%91%e4%b9%9f%e8%83%bd%e8%af%ad%e9%9f%b3%e8%bd%ac%e6%96%87%e5%ad%97%ef%bc%9amac%e5%bc%80%e6%ba%90%e7%a5%9e%e5%99%a8%e7%94%a8%e4%b8%8a%e5%8d%83%e9%97%ae%e6%a8%a1%e5%9e%8b/</guid>

					<description><![CDATA[语音转文字工具不少，但大多要联网、要注册账号、要按月付费，录音还得上传到别人的服务器。7 月 29 日，一款名 [&#8230;]]]></description>
										<content:encoded><![CDATA[
<p class="wp-block-paragraph">语音转文字工具不少，但大多要联网、要注册账号、要按月付费，录音还得上传到别人的服务器。7 月 29 日，一款名为 Qwen Scribe 的开源工具在 GitHub 上发布了首个公开测试版（v0.1.0-beta.1），思路完全相反：模型跑在本地、数据不出电脑、不要账号也不要 API 密钥，代码以 Apache-2.0 协议完全开源。项目上线当天就冲上了 Hacker News 首页。</p>



<figure data-wp-context="{&quot;imageId&quot;:&quot;6a74468c67f70&quot;}" data-wp-interactive="core/image" data-wp-key="6a74468c67f70" class="wp-block-image size-large aligncenter wp-lightbox-container"><img decoding="async" width="1200" height="600" data-wp-class--hide="state.isContentHidden" data-wp-class--show="state.isContentVisible" data-wp-init="callbacks.setButtonStyles" data-wp-on--click="actions.showLightbox" data-wp-on--load="callbacks.setButtonStyles" data-wp-on--pointerdown="actions.preloadImage" data-wp-on--pointerenter="actions.preloadImageWithDelay" data-wp-on--pointerleave="actions.cancelPreload" data-wp-on-window--resize="callbacks.setButtonStyles" src="https://mylogs.cn/wp-content/uploads/2026/07/cae8d17d9d511f239d262b66c9633f9e_header.webp" alt="断网也能语音转文字：Mac开源神器用上千问模型" class="wp-image-2492" style="max-width:100%;height:auto;" srcset="https://mylogs.cn/wp-content/uploads/2026/07/cae8d17d9d511f239d262b66c9633f9e_header.webp 1200w, https://mylogs.cn/wp-content/uploads/2026/07/cae8d17d9d511f239d262b66c9633f9e_header-300x150.webp 300w, https://mylogs.cn/wp-content/uploads/2026/07/cae8d17d9d511f239d262b66c9633f9e_header-1024x512.webp 1024w, https://mylogs.cn/wp-content/uploads/2026/07/cae8d17d9d511f239d262b66c9633f9e_header-768x384.webp 768w" sizes="(max-width: 1200px) 100vw, 1200px" /><button
			class="lightbox-trigger"
			type="button"
			aria-haspopup="dialog"
			data-wp-bind--aria-label="state.thisImage.triggerButtonAriaLabel"
			data-wp-init="callbacks.initTriggerButton"
			data-wp-on--click="actions.showLightbox"
			data-wp-style--right="state.thisImage.buttonRight"
			data-wp-style--top="state.thisImage.buttonTop"
		>
			<svg xmlns="http://www.w3.org/2000/svg" width="12" height="12" fill="none" viewBox="0 0 12 12">
				<path fill="#fff" d="M2 0a2 2 0 0 0-2 2v2h1.5V2a.5.5 0 0 1 .5-.5h2V0H2Zm2 10.5H2a.5.5 0 0 1-.5-.5V8H0v2a2 2 0 0 0 2 2h2v-1.5ZM8 12v-1.5h2a.5.5 0 0 0 .5-.5V8H12v2a2 2 0 0 1-2 2H8Zm2-12a2 2 0 0 1 2 2v2h-1.5V2a.5.5 0 0 0-.5-.5H8V0h2Z" />
			</svg>
		</button><figcaption class="wp-element-caption">图片来源：GitHub / VladUZH</figcaption></figure>





<h2 class="wp-block-heading">核心是阿里开源的千问语音模型</h2>



<p class="wp-block-paragraph">Qwen Scribe 的底层是阿里巴巴开源的 Qwen3-ASR 语音识别模型，通过 mlx-qwen3-asr 项目跑在 Mac 的 Metal GPU 上。Qwen3-ASR 是目前最强的开源语音识别模型之一，有第三方移植测试显示，它在多语言和嘈杂环境下的识别表现优于 OpenAI 的 Whisper-large-v3。</p>



<p class="wp-block-paragraph">工具提供两档模型可选：追求准确率可以用 17 亿参数版本，占用约 3.4GB 统一内存；追求速度可以用 6 亿参数版本，只占约 1.2GB 内存。模型权重在首次使用时自动下载，之后即使断网也能正常转写。</p>



<h2 class="wp-block-heading">两种用法：拖文件转写，或全局听写</h2>



<p class="wp-block-paragraph">Qwen Scribe 的功能分两块。第一块是文件转写：在本地网页界面里把音频或视频文件拖进去，工具会自动识别语言，支持强制指定语言、专有词汇提示、逐词时间戳，还能直接导出 SRT 字幕文件。所有转写记录自动保存在本地，可以随时重新打开或删除。</p>



<p class="wp-block-paragraph">第二块是系统级听写，这也是最实用的部分：在任意应用的文本输入框里，按住右侧 Command 键说话，松开后文字就会在光标处自动粘贴出来——全程在本地完成识别。屏幕上会显示一个不抢焦点的悬浮提示，标明「聆听中」「转写中」以及成功或失败状态。</p>



<p class="wp-block-paragraph">隐私设计上，这款工具做得相当细致：本地服务只监听 127.0.0.1，并做了 Host 和浏览器来源校验；听写助手只响应右 Command 键，粘贴文字前会在内存里暂存剪贴板内容，粘贴后如果剪贴板没被改动就自动恢复原状。</p>



<h2 class="wp-block-heading">上手门槛：目前需要自己动手编译</h2>



<p class="wp-block-paragraph">想尝鲜的用户需要注意几个条件：必须是搭载 Apple Silicon 芯片的 Mac，系统要求 macOS 14 或更新版本，还需要安装 Python 3.12 以上版本和 ffmpeg。</p>



<p class="wp-block-paragraph">目前的测试版只提供源码，没有现成的安装包——因为应用还没有经过苹果的开发者签名和公证，开发者不希望用户绕过系统安全警告安装未签名程序。用户需要克隆代码仓库后用 make app 命令自行编译。按照路线图，签名和公证过的正式安装包计划在 v0.2 版本推出。</p>



<p class="wp-block-paragraph">另外要说明的是，Qwen Scribe 是独立的社区项目，与阿里云、千问团队以及苹果公司均无官方关联。</p>



<p class="wp-block-paragraph">对于经常需要整理录音、写字幕，又不放心把敏感内容传到云端的用户来说，这类「模型在本地、数据不出门」的工具正在变成一个值得关注的方向——大厂的开源模型加上社区开发者的打磨，免费方案的体验已经越来越接近付费云服务。</p>



<p class="wp-block-paragraph">来源：<a href="https://github.com/VladUZH/qwen-scribe">GitHub &#8211; VladUZH/qwen-scribe</a>（via Hacker News）</p>

]]></content:encoded>
					
					<wfw:commentRss>https://mylogs.cn/%e6%96%ad%e7%bd%91%e4%b9%9f%e8%83%bd%e8%af%ad%e9%9f%b3%e8%bd%ac%e6%96%87%e5%ad%97%ef%bc%9amac%e5%bc%80%e6%ba%90%e7%a5%9e%e5%99%a8%e7%94%a8%e4%b8%8a%e5%8d%83%e9%97%ae%e6%a8%a1%e5%9e%8b/feed/</wfw:commentRss>
			<slash:comments>0</slash:comments>
		
		
			</item>
	</channel>
</rss>
