语音链路地图:ASR、TTS 与实时对话的延迟账
语音对话「说完—听懂—想好—说出」四段链路各带百毫秒级延迟,叠加起来轻易超过人类对话的停顿预算。本文摊开全链路延迟账本,拆解 VAD、流式识别、首 token 与流式合成各环节,并对比级联与端到端两条架构路线。
阅读全文 →
系列文章
ARCHIVE 共 14 条OpenAI 发布 Sora:视频生成的 GPT-3 时刻
Sora 基于扩散模型与 Transformer 架构,可直接从文本生成长达一分钟的高保真视频,展示了对物理世界'世界模拟器'式的理解潜力。
GPT-4 发布:多模态与长上下文的分水岭
OpenAI 发布 GPT-4,支持图文多模态输入,在律师资格考试等专业基准上达到人类前 10% 水平,并引入 32K 长上下文版本。
← 上一页
第 2 / 2 页 · 共 14 条