专题 · TOPIC

多模态之路

图像、语音与视频:看懂模型怎么跨过文字的边界

语言模型学会了看和听。这个专题拆解多模态的核心构件:视觉编码器与投影层怎么把图像「翻译」成语言、扩散模型怎么从噪声里画出图、语音链路的延迟账本、多模态的评测与幻觉问题——帮你建立跨模态的完整地图。

已收录 14 篇 · 持续更新 · 关键词:#多模态 #VLM #扩散模型 #语音识别 #评测基准
导读 · 本站原创 · 研究前沿

语音链路地图:ASR、TTS 与实时对话的延迟账

语音对话「说完—听懂—想好—说出」四段链路各带百毫秒级延迟,叠加起来轻易超过人类对话的停顿预算。本文摊开全链路延迟账本,拆解 VAD、流式识别、首 token 与流式合成各环节,并对比级联与端到端两条架构路线。
来源:原创2026-10-06阅读 3·访客 3
阅读全文 →

系列文章

ARCHIVE 共 14 条
OpenAI 发布 Sora:视频生成的 GPT-3 时刻
Sora 基于扩散模型与 Transformer 架构,可直接从文本生成长达一分钟的高保真视频,展示了对物理世界'世界模拟器'式的理解潜力。
大模型 精选 · OpenAI · 2024-02-16 阅读 22·访客 18
GPT-4 发布:多模态与长上下文的分水岭
OpenAI 发布 GPT-4,支持图文多模态输入,在律师资格考试等专业基准上达到人类前 10% 水平,并引入 32K 长上下文版本。
大模型 精选 · OpenAI · 2023-03-15 阅读 20·访客 19
← 上一页 第 2 / 2 页 · 共 14 条