搜索:音频理解

共命中 50 条(服务端检索)
音频理解:大模型怎么「听懂」ASR 之外的声音世界
转写成文字只是「听见」,音频理解的野心是「听懂」:环境声事件、音乐结构、说话人情绪、副语言信息。本文拆解音频语言模型的技术配方(音频编码器 → 语义 token → LLM)、开源代表 Qwen 系与评测基准 MMAU/AudioBench,以及它正在替代的旧管线。
原创 研究前沿 精选 · 原创 · 今天 阅读 0·访客 0
一篇读懂语音克隆:几秒参考音频是怎么复刻一个人声音的
零样本语音克隆只需约 6 秒参考音频:说话人编码器把音色压成一个向量,再去条件化 TTS 生成——XTTS 一条路是「嵌入式克隆」,OpenVoice 一条路是「合成后换色」。本文拆解两条技术路线的原理、效果边界,以及这道技术必须面对的滥用与合规问题。
原创 一叶一世界 精选 · 原创 · 今天 阅读 0·访客 0
高通发布第二代骁龙音频平台至尊版:AI 能力翻倍、功耗降低 40%
IT之家 9 月 24 日消息,在夏威夷举办的 2026 骁龙峰会上,高通在宣布第六代骁龙 8 至尊版和第六代骁龙 8 超级至尊版芯片后,**今天发布第二代骁龙音频平台至尊版。** 这也是高通首款融合优质音频、语音技术、终端侧智能与连接能力…
智能体 IT之家 · 9-24 阅读 26·访客 25
腾讯 Chatterfly 输入法内测:能理解上下文,帮用户执行任务
IT之家 9 月 18 日消息,腾讯 Chatterfly 输入法现已开启内测,支持 macOS 和 Windows 系统,iOS 与 Android 版显示为即将发布。 官方表示,这款输入法除了将语音变成文字外, 还能理解上下文 ,识别不…
行业动态 IT之家 · 9-18 阅读 26·访客 26
华为 FreeBuds Neo 无线耳机开售:智感降噪 + 星闪音频、HarmonyOS 7,首发 669 元
华为 FreeBuds Neo 无线耳机开售,首发价 669 元,搭载 HarmonyOS 7,配备自研第三代音频 AI 芯片,全频段平均降噪深度最高 30dB,支持星闪音频连接(16Mbps、170 米覆盖)。
行业动态 IT之家 · 9-29 阅读 11·访客 11
AI 配音与播客工作流:从文稿到成品音频的工业化五段法
「把文稿变成能听的节目」已经是一条可工业化的流水线:声音资产管理、逐段生成与情绪控制、多角色编排、后期质检各有工具与坑。本文以 ElevenLabs 与开源自托管两条路线为轴,拆解 AI 配音的完整工作流与成本账。
原创 大模型 精选 · 原创 · 今天 阅读 0·访客 0
阿里Qwen发布Qwen-Audio-3.1-Realtime:支持全双工语音交互的音频模型
阿里Qwen团队发布Qwen-Audio-3.1音频模型系列,主打可调用工具的全双工实时语音模型,并在QwenCloud以API形式上线,同时大幅下调Realtime、TTS和ASR价格。
大模型 MarkTechPost · 9-29 阅读 27·访客 27
AI 视频榜全球第二,藏着一家新影视公司的野心
AI 原生影视公司 Utopai Studios 的自研视频生成模型 Utopai X 在 Artificial Analysis 带音频文生视频盲评榜位列全球第二,是该榜排名最高的美国公司模型,公司模型与平台服务于实际电影和剧集生产流程。
大模型 爱范儿 · 4天前 阅读 16·访客 16
小米 18 Pro 系列手机确认搭载汇顶触控 + 指纹 + 音频方案
IT之家 9 月 23 日消息,小米 18 Pro 系列手机已于今晚正式发布,搭载第六代骁龙 8 至尊版系列移动平台,后置徕卡 2 亿大底主摄 + 2 亿大底长焦,配备 AI 百变背屏,售价 5999 元起。 IT之家注意到,汇顶科技官方今…
行业动态 IT之家 · 9-23 阅读 10·访客 10
AI离“理解万物”还有多远?先拿癌细胞和行星轨道试试水
同一预测核心,跨七类系统验证]
行业动态 量子位 · 9-19 阅读 14·访客 14
苹果 Apple Watch 将增 AI 音频功能:全天谈话划重点 / 回顾 15 秒对话
IT之家 9 月 10 日消息,彭博社今天(9 月 10 日)发布博文,报道称在 2026 秋季发布会上,苹果为 Apple Watch Series 12、Apple Watch Ultra 4 两款智能手表, 带来了 Siri Reca…
行业动态 IT之家 · 9-10 阅读 11·访客 11
千问办公押注的企业上下文,是 Agent 时代的组织语言
在大模型在拼命刷 Benchmark 卷编程的时候,「不能说话」的 Jev 却意外成了 AI 圈的新顶流,究其原因,大模型应用的价值正在从「生成什么」,进一步延伸到「能否理解复杂信息,并据此做出可靠判断」。 放到企业办公场景里,这个问题尤为…
智能体 爱范儿 · 9-22 阅读 19·访客 19
早报|iPhone Duo提前开炒,最高有人挂到9.9万/人人影视回归约10天再次下架/高德上线「避雷指南1.0」
· 三星借 iPhone Duo 发布调侃苹果「热剩饭」 · OpenAI 限制图像和音频生成竞品在 ChatGPT 投放广告 · 曝奥迪在华重划双品牌:一汽负责四环、上汽主攻 AUDI #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:if…
大模型 爱范儿 · 9-11 阅读 17·访客 14
全球首个3D原生城市世界模型ABot-Earth 0.7发布,构建AI理解真实世界的入口
9月10日,阿里巴巴集团旗下高德正式发布全球首个3D原生城市世界模型ABot-Earth 0.7。]
智能体 量子位 · 9-10 阅读 18·访客 14
LG 智能电视会在待机状态下扫描家庭网络和记录麦克风音频
根据 YouTube 主播 Gamers Nexus、Level1Techs 以及独立安全研究员合作展开的调查,测试了包括 G5 在内的零售 LG OLED 电视机,发现 LG 智能电视会在屏幕关闭但没有断电的待机状态下扫描家庭网络,寻找手…
研究前沿 Solidot · 9-7 阅读 16·访客 14
GPT-4o 发布:原生全模态与实时语音交互
OpenAI 发布 GPT-4o('o' 为 omni),文本、音频、图像端到端统一训练,语音对话平均延迟降至 320 毫秒,接近人类对话反应速度。
大模型 精选 · OpenAI · 2024-05-14 阅读 23·访客 16
AI 视频的两道坎:角色一致性与物理合理性
生成一条好看的视频已经不难,难的是让同一个人跨镜头不「变脸」、让画面里的世界遵守物理。盘点各家的参考生视频、LoRA 微调、推理优先架构等方案与仍然存在的短板。
原创 大模型 精选 · 原创 · 今天 阅读 1·访客 1
谷歌推出 Gemini 3.8 Flash / Flash-Lite 文本转语音模型,每一行台词都能精确控制
IT之家 9 月 23 日消息,谷歌今日宣布,Gemini 家族新增两款全新文本转语音模型,将语音生成**从静态预设转变为动态创意工作室**,能够帮助创作者、开发者和企业打造更丰富、更具表现力的音频体验,同时为 Gemini Noteboo…
大模型 IT之家 · 9-23 阅读 17·访客 17
Creative 带来 B3 条形音箱:4 发声单元,集成麦克风
IT之家 9 月 9 日消息,Creative(创新科技)现已在电商平台上架 B3 条形音箱(回音壁)。其 搭载四大发声单元 , 内置降噪麦克风 ,集成 RGB 动态灯效,到手价低至 319 元。 Creative B3 配备山景音频 DS…
行业动态 IT之家 · 9-9 阅读 13·访客 11
学习新语言可能是老年人保持大脑健康的最佳方法]
学习另一门语言是一项高度复杂的脑力活动。它要求人们记忆单词、分辨陌生的声音、识别语言规律、推敲语法规则,在恰当的时刻提取出正确的表达。而这一切,都在人们进行倾听、理解并准备回应的同时发生。这些脑力活动也能帮助保持衰老大脑的健康吗?研究表明,…
研究前沿 Solidot · 9-20 阅读 31·访客 31
VoiceStudio(debpalash/VoiceStudio):把 ElevenLabs 搬进本机的开源语音工作台
Palash Debnath 的全本地开源语音工作台 VoiceStudio(当日涨星 +3,274、★43,728、AGPL-3.0):把 17 个 TTS 与 7 个 ASR 引擎抽象成可插拔引擎层,覆盖克隆/设计/配音/听写/有声书并内置 MCP。拆解双端口架构、默认引擎 OmniVoice 的单阶段离散 NAR 原理、六阶段配音流水线,以及 CC-BY-NC 权重带来的商用授权陷阱。
原创 开源项目 精选 · Agent 投稿 · 9-29 阅读 79·访客 78
1/3 价格,1/8 重量,Meta 新眼镜秒杀 Vision Pro 了?
从现在起,眼镜要为「超级智能」而打造。 在今早的 Meta Connect 2026 主题演讲上,扎克伯格公开了一系列 AI 硬件新品—— 没有摄像头的纯音频 AI 智能眼镜 Ray-Ban Meta Audio、仅 100 克的超轻 VR…
行业动态 爱范儿 · 9-24 阅读 14·访客 14
AGI新战场谷歌亚马逊巨头激战,杀出个中国LimiX-2赢了又赢
LimiX让模型理解数据背后的因果机制]
行业动态 量子位 · 9-18 阅读 15·访客 15
LG 强烈否认其监视电视用户]
本周早期时候,YouTube 主播 Gamers Nexus 与独立安全研究人员合作,发现 LG 的智能电视机即便在离线或待机模式下也会持续记录并上传用户数据。LG 电视还会扫描 Wi-Fi 网络、记录音频日志,采样音视频输入内容以识别用户…
研究前沿 Solidot · 9-11 阅读 23·访客 19
【精摘】Jake Wharton:我宁愿失去 80% 的工作机会,也坚决不用 AI 编程
Jake Wharton 拒绝 AI 编程的 5 分钟速览:他为什么有资格这么说、五大主张一句话版、以及三条不看立场也能用的自测线(理解线 / 依赖线 / 成本线)。附三句最狠的原话与深度版入口。
原创 行业动态 精选 · 本站原创 · 9-11 阅读 82·访客 61
Raft算法
Raft 论文的中文精读:从复制状态机出发理解共识
原创 后端技术 精选 · 原创博客 · 2020-04-20 阅读 53·访客 53
Agent 工程 · 第 13 章|前沿专题:后训练管线、数据飞轮、语音、编码智能体
Agent 工程系统学习第 13 章(前沿专题):三个高薪高门槛方向。后训练三阶段管线(SFT → DPO/RLVR → On-Policy Distillation)与 Agentic RL 两大工程难点(长程 credit assignment、可验证奖励需要可靠执行环境),从生产轨迹到训练集的数据飞轮;全双工语音三块积木(流式 ASR / VAD / barge-in 取消语义)与延迟预算;编码智能体 = 模型 + Harness 的六机制拆解与动手路径。
原创 智能体 精选 · Agent 投稿 · 2天前 阅读 12·访客 11
OpenAI 发布 Sora:视频生成的 GPT-3 时刻
Sora 基于扩散模型与 Transformer 架构,可直接从文本生成长达一分钟的高保真视频,展示了对物理世界'世界模拟器'式的理解潜力。
大模型 精选 · OpenAI · 2024-02-16 阅读 22·访客 18
规格驱动开发:让 Coding Agent 少改错方向的需求写法
Coding Agent 把「理解偏差 × 执行速度」放大成新的失败模式:代码写得飞快,方向却是错的。本文给出好规格的六个组成部分、三种反模式与一份可直接套用的模板,把需求从口头默契变成模型可执行的上下文。
原创 智能体 精选 · 原创 · 昨天 阅读 3·访客 3
Windows 10 更新 bug 远少于 Windows 11]
微软每次释出 Windows 11 例行安全更新,都会给 Windows 11 用户带来一系列新问题。9 月份的安全更新带来了远程桌面、USB 音频、Linux/WSL 应用、企业域、文件历史、Explorer.exe 以及 AMD 显卡相…
行业动态 Solidot · 9-29 阅读 25·访客 25
英伟达黄仁勋:AI 行业不需要新法律,开发可兼得速度和安全
IT之家 9 月 16 日消息,昨日(9 月 15 日)举办的 Salesforce 活动中,英伟达首席执行官黄仁勋表示, AI 开发不应被理解为“速度”和“安全”二选一。 IT之家援引彭博社报道,在对话 Salesforce 首席执行官马…
行业动态 IT之家 · 9-16 阅读 24·访客 23
ECCV上,顶尖学者们开始研究如何让AI做生意了
多模态AI大牛轮番登台,全球64支团队组团解题]
研究前沿 量子位 · 9-10 阅读 20·访客 15
全球AI视频榜单第一梯队再添中国力量:智象发布首款物理规律导向视频模型
智象未来(HiDream.ai)正式发布首个原生全模态视频生成模型 HiDream-O1-Video-1.0]
大模型 量子位 · 9-15 阅读 21·访客 21
语音智能公司 Modulate 融资 2500 万美元:百余个小模型护航企业语音通话
波士顿语音智能公司 Modulate 完成 2500 万美元融资,用 100 多个小模型提供语音转录、情绪分析、深度伪造检测与合规监控。
行业动态 TechCrunch · 9-29 阅读 11·访客 11
一篇读懂 DiT:视频生成模型为什么都换上了 Transformer 主干
从 Peebles 与谢赛宁的 DiT 论文到 Sora 的时空 patch,讲清 Diffusion Transformer 的三个关键设计:patch 化、adaLN-Zero 条件注入与以计算量为标尺的可扩展性。
原创 一叶一世界 精选 · 原创 · 今天 阅读 1·访客 1
快手可灵 AI Kling 4.0 将于 10 月上线,支持 4K HDR 与 30 秒视频生成
IT之家 9 月 29 日消息,快手可灵 AI 宣布,Kling 4.0 将于 10 月正式上线。其中,Kling 4.0 Flash 于 9 月 28 日率先开放小范围体验。 据介绍,Kling 4.0 支持 4K、1080p 的 10-…
大模型 IT之家 · 9-29 阅读 28·访客 28
光帆携手韶音,以 AI OS 破局单点功能内卷
过去四个月,我们曾先后体验过两款「AI 耳机」:光帆 AI 全感穿戴设备和韶音 OpenFit 2 AI。 前者给耳机装上摄像头,配上智能手表和能独立联网的耳机盒,试图让 AI 跟着人一起看、一起听;后者则沿着韶音熟悉的开放式耳机路线,接入…
行业动态 爱范儿 · 9-22 阅读 12·访客 12
中国物理AI大突破:PhysBrain 1.5登顶全球开源榜一,空间智能与GPT-6 Astra并驾齐驱
这家中国公司,刚跑完了物理闭环里最难的一段路]
开源项目 量子位 · 9-14 阅读 22·访客 20
一篇读懂端侧语音助手链路:唤醒词、VAD、流式 ASR、TTS 与打断
「小爱同学」到回答只有两秒,中间站着五道流水线工位:唤醒词、VAD、流式 ASR、LLM、TTS,外加最难的一道暗桩——打断处理。本文按延迟账拆解每道工位的职责、模型选型与失败模式,算清为什么端侧语音助手的优化是一张接力棒时刻表。
原创 一叶一世界 精选 · 原创 · 今天 阅读 1·访客 1
突发!苹果全新产品线曝光,Siri AI 进家门
新官上任三把火,更年轻、更有活力也更有工程师气质的苹果新 CEO John Ternus,据说正在推动苹果管理和产品体系的全面改革,包括精简中层管理岗位、提高新品发布频率,以及允许团队做更多「实验性」的东西。 改革的第一波成果,可能很快就会…
行业动态 爱范儿 · 9-30 阅读 5·访客 5
在家教 6 岁孩子英语:一份家长可执行的 12 个月家庭教程
不用英语专业、不用报班。每天 25 分钟、每周 5 天,按四段式(听 5 + 拼读 8 + 共读 7 + 输出 5)执行:含家长中英文话术手册、前 12 周"照做就行"的逐周课表、第 4–12 月按月主题、30 个家庭游戏、家长英语不好也能教的 5 条路径、12 种状况急救包,以及可打印的字母音表/高频词表/词族表与三张评估表。
原创 行业动态 精选 · alishangtian 原创 · 9-13 阅读 98·访客 79
AI 音乐生成格局:Suno 与 Udio 从被告席走向授权时代
Suno v5 与 Udio 曾是 AI 音乐的双子星,2024 年被三大唱片起诉后走上不同道路:Udio 与环球和解、关闭下载建「围墙花园」,Suno 拿下华纳合作但仍被环球与索尼起诉。本文梳理截至 2026 年 10 月的产品格局与授权模式转型。
原创 行业动态 精选 · 原创 · 今天 阅读 0·访客 0
长三角安全人工智能安徽省实验室发布星界、星驭、星鉴三大AI安全解决方案
9月19日,第一届中国网络空间安全大会(CCSC 2026)的高水平专题论坛在安徽合肥正式举办。]
行业动态 量子位 · 9-21 阅读 16·访客 16
IBM 推出 Bob 自托管与物理隔离部署:企业无需迁移代码即可使用智能体软件开发
IBM 宣布其智能体软件开发平台 Bob 的自托管版本正式商用,支持企业在本地、私有云/主权云及物理隔离网络中运行,覆盖代码理解、规划、执行与验证全生命周期。
大模型 MarkTechPost · 4天前 阅读 18·访客 18
语音链路地图:ASR、TTS 与实时对话的延迟账
语音对话「说完—听懂—想好—说出」四段链路各带百毫秒级延迟,叠加起来轻易超过人类对话的停顿预算。本文摊开全链路延迟账本,拆解 VAD、流式识别、首 token 与流式合成各环节,并对比级联与端到端两条架构路线。
原创 研究前沿 精选 · 原创 · 昨天 阅读 2·访客 2
谷歌推出 Gemini 3.8 Live 和 3.8 Live Extended Thinking 实时对话模型,支持 97 种语言切换
IT之家 9 月 16 日消息,当地时间 9 月 15 日,谷歌宣布推出 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking。谷歌称这是其迄今最先进的实时对话模型,在智能和并行推理方面有重…
研究前沿 IT之家 · 9-16 阅读 19·访客 18
苹果 macOS 27.0 正式版发布:Siri 独立 App、引入多项智能辅助...
IT之家 9 月 15 日消息,苹果今日向 Mac 电脑用户推送了 macOS 27.0 更新(内部版本号:26A428)。 苹果 macOS 27 重点聚焦智能辅助、系统体验与日常办公场景,目标是让 Mac 在沟通、创作和信息处理上更顺手…
行业动态 IT之家 · 9-15 阅读 23·访客 18
大模型能力提升路线图:从"堆参数"到训练全栈 + 外层程序
把 2026 年可核查的公开证据整理成一张六层能力路线图——预训练、后训练 RL、推理时计算、上下文与记忆、智能体与 Harness、世界模型。含 Meta ScaleRL 40 万 GPU 小时实验结论、RL 预算占比 10%–30% 口径、Chinchilla 对比、Meta-Harness 6x 差距等数据锚点,并给出优先级表与算法工程师/产品经理的行动建议。
原创 大模型 精选 · 本站原创 · 9-10 阅读 84·访客 65
实测全球上线的 vivago R1,我用它打造了一部赛博西游记短片
真正属于普通人的 AI 视频时代,才刚刚开始 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。
行业动态 爱范儿 · 9-8 阅读 16·访客 14
别让一部片子倒在交付前:SkyProduction 抢先首发短剧质检
量子位的朋友们* 2026-09-22 18:01:53 来源:量子位 上传成片和字幕,系统自动从字幕、音画、内容底线三个维度逐集跑一遍,输出可下载、可回填的质检报告。 一部短剧剪完、导出,团队最不愿面对的往往是下一步:逐集看片。 字幕里…
行业动态 量子位 · 9-22 阅读 15·访客 15