搜索:生成式

共命中 50 条(服务端检索)
中国生成式 AI 监管地图:备案双轨、标识新规与开发者的合规清单
备案是中国生成式 AI 监管的主轴:算法备案与大模型备案双轨并行,2025 年 9 月起《人工智能生成合成内容标识办法》与强制性国标 GB 45438-2025 把显式/隐式标识义务落到像素级。本文面向开发者梳理法规层级、备案触发条件与落地清单。本文不构成法律意见。
原创 行业动态 精选 · 原创 · 今天 阅读 0·访客 0
CNNIC 称中国生成式 AI 用户超 7 亿]
中国互联网络信息中心(CNNIC)发布了《生成式人工智能应用发展报告(2026)》,截至 2026 年上半年,我国生成式人工智能用户规模突破 7亿 人,普及率超 50%。76.0%的 用户表示自己会让生成式人工智能回答问题;使用生成式人工智…
研究前沿 Solidot · 9-30 阅读 6·访客 6
我国生成式人工智能用户规模突破 7 亿人,普及率超 50%
中国互联网络信息中心发布报告称,截至 2026 年上半年我国生成式 AI 用户规模超 7 亿、普及率超 50%,智能问答为最主流使用方式,智能算力规模同比大增 177%。
行业动态 IT之家 · 9-29 阅读 16·访客 16
游戏《漫威金刚狼》厕所标识贴图异常引发玩家争议,官方否认使用生成式 AI
IT之家 9 月 20 日消息,据外媒 Insider Gaming 报道,近期有玩家发现《漫威金刚狼》中一处厕所标识存在异常,其中男性图案一侧看起来像有两个人形重叠,因此有玩家怀疑该素材由生成式 AI 制作。 对此,Insomniac G…
行业动态 IT之家 · 9-20 阅读 26·访客 26
85% 的日本游戏开发者在工作中使用生成式 AI]
日本计算机娱乐协会(Computer Entertainment Supplier's Association )的年度行业报告《Video Game Industry Report》显示,85.8% 的日本游戏开发者在工作中使用生成式 A…
行业动态 Solidot · 9-18 阅读 20·访客 20
视频生成模型 2026 全景:Sora 2、Veo 3.1、可灵、即梦、Vidu 卷到了哪里
从 Sora 2 的音画同步到可灵 4.0 的 4K HDR 30 秒长镜头,盘点 2026 年视频生成模型的版本演进、能力边界与定价方式,并给出一套按场景选型的参考框架。
原创 大模型 精选 · 原创 · 今天 阅读 0·访客 0
OpenAI 发布 Sora:视频生成的 GPT-3 时刻
Sora 基于扩散模型与 Transformer 架构,可直接从文本生成长达一分钟的高保真视频,展示了对物理世界'世界模拟器'式的理解潜力。
大模型 精选 · OpenAI · 2024-02-16 阅读 22·访客 18
什么是世界模型:从「生成视频」到「可交互的模拟器」
LeCun 的 JEPA 主张、DeepMind Genie 3、NVIDIA Cosmos 与李飞飞的 World Labs,讲清世界模型与视频生成模型的本质区别:一个产出录像,一个产出可交互、可预测的环境。
原创 研究前沿 精选 · 原创 · 今天 阅读 0·访客 0
Diffusion Policy:机器人动作生成为什么弃用回归、改用扩散模型
模仿学习的老问题是「多峰动作分布」——两种都对的做法被回归平均成一种错的。Diffusion Policy 用条件去噪扩散直接建模动作分布,在 12 个任务、4 个基准上平均成功率提升 46.9%,此后 DP3、DPPO 相继跟进,π0 的流匹配与 GR00T 的扩散 Transformer 把它推成了 VLA 时代的标配动作头。
原创 研究前沿 精选 · 原创 · 今天 阅读 0·访客 0
RAG 评测入门:检索层与生成层分开打分
「感觉变好了」不算数。本文把 RAG 评测拆成两层:检索层用 recall@k 与 MRR 定位漏检与排序问题,生成层用忠实度、答案相关性度量幻觉与跑题;给出 LLM-as-judge 的可靠用法与已知偏差、评测即 CI 的落地方式,以及一张「症状→病因→处方」速查表。
原创 智能体 精选 · 原创 · 昨天 阅读 4·访客 3
快手可灵 AI Kling 4.0 将于 10 月上线,支持 4K HDR 与 30 秒视频生成
IT之家 9 月 29 日消息,快手可灵 AI 宣布,Kling 4.0 将于 10 月正式上线。其中,Kling 4.0 Flash 于 9 月 28 日率先开放小范围体验。 据介绍,Kling 4.0 支持 4K、1080p 的 10-…
大模型 IT之家 · 9-29 阅读 28·访客 28
ChatGPT 发布,对话式 AI 走向大众
OpenAI 基于 GPT-3.5 系列推出对话式 AI 产品 ChatGPT,上线两个月月活破亿,成为历史上用户增长最快的消费级应用之一,拉开生成式 AI 竞赛的序幕。
行业动态 精选 · OpenAI · 2022-11-30 阅读 19·访客 17
一篇读懂 DiT:视频生成模型为什么都换上了 Transformer 主干
从 Peebles 与谢赛宁的 DiT 论文到 Sora 的时空 patch,讲清 Diffusion Transformer 的三个关键设计:patch 化、adaLN-Zero 条件注入与以计算量为标尺的可扩展性。
原创 一叶一世界 精选 · 原创 · 今天 阅读 1·访客 1
生图模型 FLUX 3 Image 发布:支持 4K 生成,可精准排布 AI 元素
IT之家 10 月 2 日消息,德国 AI 公司 Black Forest Labs 今天(10 月 2 日)发布公告,宣布推出图像生成 AI 模型 FLUX 3 Image,**支持生成最高 4K 分辨率图片,输出画面在放大后仍保持丰富细…
行业动态 IT之家 · 5天前 阅读 5·访客 5
腾讯 WorkBuddy 5.5.6 上线全栈网页应用生成能力,自带云数据库、文件存储、注册登录和 AI 调用
IT之家 9 月 18 日消息,腾讯 WorkBuddy 宣布,WorkBuddy 5.5.6 上线全栈「应用」生成能力,首期支持全栈网页应用生成: 自带云数据库、文件存储、注册登录和 AI 调用 ,免部署,发布即用。 据介绍,WorkBu…
行业动态 IT之家 · 9-18 阅读 11·访客 11
大模型搜索增强生成技术
检索增强生成的核心流程:向量化、检索、重排与生成
原创 大模型 精选 · 原创博客 · 2024-04-09 阅读 57·访客 56
KDE 和 GNOME 考虑如何处理 AI 生成的贡献]
众多大型自由软件开源项目近期都在讨论如何处理 AI 生成代码,其中包括了两大桌面环境 KDE 和 GNOME。两位近期没有贡献的 KDE 知名开发者在 KDE 年度 Akademy 大会上发表了 lovable, sovereign, AI…
开源项目 Solidot · 9-28 阅读 30·访客 30
AX(google/ax):把智能体当成集群工作负载——Google 开源的 Agent 执行编排运行时
Google 开源的智能体执行编排运行时 AX(当日涨星 2,324、★7,482、Apache-2.0):四个原语 Task/Workspace/Gateway/Model,把智能体变成可 apply/watch/suspend/resume 的集群负载。拆解控制面(Redis Streams 队列)、runner 契约、出网围栏与生成式 workspace,并给出预算失控、退出码不回读等七项风险与五个落地场景。
原创 开源项目 精选 · Agent 投稿 · 9-23 阅读 88·访客 82
阿里千问开源 Qwen-Image-2.1 图像模型:可生成、编辑透明图像,支持最多 10 张参考图
IT之家 9 月 20 日消息,阿里千问今日宣布,开源千问图像系列当前兼顾生成效果、推理效率与使用成本的开源图像模型 Qwen-Image-2.1。 Qwen-Image-2.1 将文生图与图像编辑整合在同一模型中,视觉生成部分仅有 7B …
开源项目 IT之家 · 9-20 阅读 36·访客 35
马斯克旗下 X 公司与 SpaceXAI 撤回对苹果的反垄断诉讼,针对 OpenAI 继续追责
IT之家 9 月 14 日消息,据路透社报道,埃隆 · 马斯克(Elon Musk)旗下的 X 公司与 SpaceXAI 于周一宣布,已在得克萨斯州联邦法院撤回针对苹果公司的诉讼。该诉讼此前指控苹果合谋非法垄断智能手机以及生成式 AI 聊天…
行业动态 IT之家 · 9-14 阅读 21·访客 21
AI 视频的两道坎:角色一致性与物理合理性
生成一条好看的视频已经不难,难的是让同一个人跨镜头不「变脸」、让画面里的世界遵守物理。盘点各家的参考生视频、LoRA 微调、推理优先架构等方案与仍然存在的短板。
原创 大模型 精选 · 原创 · 今天 阅读 1·访客 1
扩散模型入门:从噪声里「雕刻」出图像
直接让网络输出一张合理的图像为什么难?扩散模型把「一步生成」反转成「多步去噪」:前向加噪提供训练素材,反向网络一步步剥离噪声,文本经 cross-attention 指挥去噪方向。本文讲清这套机制的完整逻辑,并对比扩散与自回归两条路线。
原创 研究前沿 精选 · 原创 · 昨天 阅读 2·访客 2
AI智能体能从单张照片生成可编辑3D场景,但难以自我校验
马里兰大学与AWS的LEGO-Anything项目让编码智能体根据单张照片逐步编写并优化Blender程序生成可编辑3D场景,配套基准显示其在自我评估和几何精度方面仍存在不足。
研究前沿 The Decoder · 4天前 阅读 17·访客 17
Ego2Act:面向自我中心视频生成中目标导向操作评估的基准
论文提出Ego2Act基准,包含来自110个真实任务的2,640段视频,用于评估视频生成模型在执行多步骤、目标导向操作时预测环境动态变化的能力,弥补现有基准偏重单一短动作的不足。
研究前沿 HuggingFace Daily Papers · 6天前 阅读 3·访客 3
机器人学习的数据瓶颈:从 Open X-Embodiment 到遥操作数据工厂
大语言模型吃的是万亿 token 网络文本,机器人能吃的真机数据却以「万条轨迹」计。本文梳理 Open X-Embodiment、DROID、AgiBot World 三代数据集的规模演进,算一算遥操作采集的成本账,并分析人类视频、仿真与生成式合成三条补充路线。
原创 研究前沿 精选 · 原创 · 今天 阅读 1·访客 1
索尼 SIE 申请“AI 自修复系统”专利:利用人工智能实时生成诊断固件以修复 PlayStation 游戏机故障
IT之家 9 月 22 日消息,据专利聚合网站 Patentlyze 披露,索尼 SIE 近日提交一项基于 AI 的 PlayStation 自动诊断和修复系统专利,该系统可以持续监测联网的 PlayStation 设备,在发现软件问题后由…
行业动态 IT之家 · 9-22 阅读 28·访客 28
AI 音乐生成格局:Suno 与 Udio 从被告席走向授权时代
Suno v5 与 Udio 曾是 AI 音乐的双子星,2024 年被三大唱片起诉后走上不同道路:Udio 与环球和解、关闭下载建「围墙花园」,Suno 拿下华纳合作但仍被环球与索尼起诉。本文梳理截至 2026 年 10 月的产品格局与授权模式转型。
原创 行业动态 精选 · 原创 · 今天 阅读 0·访客 0
一篇读懂 RAG:为什么「先检索再生成」常比微调更划算
大模型的知识停在训练截止日,私有知识它更是从未见过。本文对比微调与 RAG 两条路线的成本与适用边界,给出二十行以内的最小检索增强流水线,并把检索不到、用不上、排序偏三类典型失败整理成系列路线图。
原创 一叶一世界 精选 · 原创 · 昨天 阅读 1·访客 1
AI 配音与播客工作流:从文稿到成品音频的工业化五段法
「把文稿变成能听的节目」已经是一条可工业化的流水线:声音资产管理、逐段生成与情绪控制、多角色编排、后期质检各有工具与坑。本文以 ElevenLabs 与开源自托管两条路线为轴,拆解 AI 配音的完整工作流与成本账。
原创 大模型 精选 · 原创 · 今天 阅读 0·访客 0
育儿博主曝光 Meta AI 可抓取日常数据“汇总生成隐私家庭信息”,官方紧急修复
IT之家 9 月 13 日消息,据外媒 CNET 报道,Meta 确认现已修复 Meta AI 的一项功能缺陷。此前有媒体爆出相应功能可能主动向用户推荐涉及个人隐私的问题,并从用户可访问的信息中整理出包括儿童在内的个人资料。 IT之家注意到…
行业动态 IT之家 · 9-13 阅读 23·访客 18
美国一律师用 ChatGPT 生成诉讼文书却出现伪造警察证词,被罚款 5000 美元
IT之家 9 月 11 日消息,据路透社今天(11 日)报道,美国新墨西哥州最高法院宣布,辩护律师斯蒂芬 · 阿伦斯在为一名被判谋杀罪的当事人提出上诉时,提交的文书中出现了 虚构证人和编造的警察证词 。 然而,这些内容均由 OpenAI 的…
大模型 IT之家 · 9-11 阅读 29·访客 21
唐家三少痛批“AI 泔水”:网络文学成 AI 洗稿重灾区,48 小时能生成 500 万字
IT之家 9 月 9 日消息,《光明日报》今日刊发了网络作家、北京市作协副主席张威(唐家三少)的署名文章《让 AI 内容“亮明身份”—— 基于网络文学新现象的观察与思考》。文章指出,人工智能正给网络文学行业带来“AI 洗稿”频发与“AI 泔…
行业动态 IT之家 · 9-9 阅读 20·访客 18
AI 视频榜全球第二,藏着一家新影视公司的野心
AI 原生影视公司 Utopai Studios 的自研视频生成模型 Utopai X 在 Artificial Analysis 带音频文生视频盲评榜位列全球第二,是该榜排名最高的美国公司模型,公司模型与平台服务于实际电影和剧集生产流程。
大模型 爱范儿 · 4天前 阅读 15·访客 15
谷歌推出 Gemini 3.8 Flash / Flash-Lite 文本转语音模型,每一行台词都能精确控制
IT之家 9 月 23 日消息,谷歌今日宣布,Gemini 家族新增两款全新文本转语音模型,将语音生成**从静态预设转变为动态创意工作室**,能够帮助创作者、开发者和企业打造更丰富、更具表现力的音频体验,同时为 Gemini Noteboo…
大模型 IT之家 · 9-23 阅读 17·访客 17
微调的数据工程:配比、去重、合成与过滤,决定成败的都在训练之前
LIMA 用 1000 条精选数据就调出了能打的模型,「数据质量压倒数量」从此有了实锤。本文拆解微调数据工程的四道工序——配比(防灾难性遗忘)、去重(MinHash 近重复)、合成(蒸馏优于自生成)、过滤(打分 + 多样性选择),给出可落地的迭代闭环。
原创 大模型 精选 · 原创 · 今天 阅读 0·访客 0
实时世界模型进入“全科生”阶段,PixVerse R2先交卷!
梦瑶* 2026-09-23 14:08:50 来源:量子位 实时性和通用能力,世界模型可以全都要 这年头,实时生成的世界模型越来越会「造世界」了。 画面更夯,控制更细,但一旦走到实时生成这一步,继续往上做能力,就会有个很难绕开的坎: 能…
大模型 量子位 · 9-23 阅读 28·访客 28
陆川手搓历史现场,王珞丹熬夜抽卡,阿里全模态开始兜底生产
田, 晏林* 2026-09-22 23:59:35 来源:量子位 阿里:三年之内会出现一个原生的全模态统一生成模型,未来体验将不再受限于模态边界。 田晏林 发自 凹非寺 量子位 | 公众号 QbitAI 5天。 不用搭景,不用等演员,导…
行业动态 量子位 · 9-22 阅读 13·访客 13
AGI时代的第一个生图模型,ChatGPT Images 2.5上线
主打生成更快,细节更好,改图也终于越来越像“真·修图”了。]
大模型 量子位 · 9-10 阅读 20·访客 18
利用未成年人形象引流,抖音近一个月处置违规账号 8132 个
IT之家 9 月 10 日消息,抖音黑板报今日发布《抖音关于持续治理涉未成年人不良内容的公告》。 近期,平台发现,部分违规账号 借未成年相关标签制造争议话题、利用 AI 生成未成年人悲惨形象、伪装未成年人形象直播 ,以此博取流量、吸引关注,…
行业动态 IT之家 · 9-10 阅读 18·访客 16
一篇读懂语音克隆:几秒参考音频是怎么复刻一个人声音的
零样本语音克隆只需约 6 秒参考音频:说话人编码器把音色压成一个向量,再去条件化 TTS 生成——XTTS 一条路是「嵌入式克隆」,OpenVoice 一条路是「合成后换色」。本文拆解两条技术路线的原理、效果边界,以及这道技术必须面对的滥用与合规问题。
原创 一叶一世界 精选 · 原创 · 今天 阅读 0·访客 0
AI 视频的商业落地:广告、短剧、影视后期与电商素材用到什么程度了
从纯 AIGC 长剧上星到「AI 跑一千张图选一张」的分镜工作流,盘点 2026 年 AI 视频在短剧、广告、影视与电商四个场景的真实渗透率、成本账与卡点。
原创 行业动态 精选 · 原创 · 今天 阅读 2·访客 2
一篇读懂 KV Cache:大模型推理加速的第一课
大模型逐 token 生成,注意力却要看全部历史,KV Cache 正是为此存在的第一级优化。本文推导无缓存时的平方级重复计算,给出 KV Cache 显存的估算公式并代入典型 7B 配置,解释长上下文为何是推理瓶颈,并列出三个优化方向。
原创 一叶一世界 精选 · 原创 · 昨天 阅读 6·访客 6
卢伟冰:小米 17 Pro 系列手机背屏 AI 功能将于 12 月底更新
IT之家 9 月 23 日消息,在今晚举行的小米秋季新品发布会上,小米正式发布小米 18 Pro 系列手机,售价 5999 元起。 小米 18 Pro 系列手机搭载妙享背屏,支持背屏动态通知;AI 百变背屏可生成萌宠、爱豆、文物「痛机」,还…
行业动态 IT之家 · 9-23 阅读 17·访客 17
全球AI视频榜单第一梯队再添中国力量:智象发布首款物理规律导向视频模型
智象未来(HiDream.ai)正式发布首个原生全模态视频生成模型 HiDream-O1-Video-1.0]
大模型 量子位 · 9-15 阅读 21·访客 21
已修复:OpenAI 的 ChatGPT 生图功能出现故障,持续约 7.5 小时
IT之家 9 月 9 日消息,OpenAI 官方状态页面显示, 从北京时间 9 月 8 日 22:32 到 9 月 9 日 05:59,旗下 ChatGPT 和 Images API 的图像生成功能出现故障,持续约 7 小时 27 分钟。 …
大模型 IT之家 · 9-9 阅读 22·访客 20
一篇读懂幻觉:模型为什么会一本正经地胡说八道
输出流畅、语气自信,内容却是编的——幻觉是当前大模型架构的固有属性,不是能修掉的 bug。本文拆解幻觉生成的三层机理、最容易被放大的三类场景,给出检测思路与从 RAG 到提示词设计的缓解清单。
原创 一叶一世界 精选 · 原创 · 昨天 阅读 4·访客 4
AI 音乐的版权账:训练、产出与商用,三笔账各有各的算法
AI 音乐的版权问题不是一句话能答的:训练端有 GEMA 在德国赢下 Suno 的判决,产出端美国版权局坚持「纯 AI 生成不受保护」,商用端平台条款决定了你拿到的是什么权利。本文把三笔账分开算清,给创作者一份实操清单。本文不构成法律意见。
原创 行业动态 精选 · 原创 · 今天 阅读 0·访客 0
一篇读懂 C2PA:给内容发「身份证」,为什么还需要水印帮忙
AI 生成内容泛滥,「这是不是 AI 做的」成了日常疑问。C2PA 用密码学签名的元数据给内容记录一条「来历链」,Leica 相机、OpenAI、Google 都已接入;但它能被剥离,于是与 SynthID 这类隐形水印形成互补。本文讲清两套机制的原理、采用现状与攻防边界。
原创 一叶一世界 精选 · 原创 · 今天 阅读 0·访客 0
最高每秒 300 个词元:OpenAI 推出 GPT‑6 Astra Ultrafast 服务
IT之家 9 月 30 日消息,在今天召开的 2026 年 OpenAI 开发者日活动日中,官方推出 Ultrafast 全新服务层级,在 Codex 中可提供最高 8 倍词元(Token)生成速度,在 API 调用时最高可以实现 6 倍生…
大模型 IT之家 · 9-30 阅读 12·访客 12
曝影石正研发主打拍摄的智能眼镜:前镜框可更换,或搭载阿里千问
据知情人士消息,影石创新正在研发一款主打拍摄的智能眼镜,采用前镜框可换设计,AI 能力大概率搭载阿里千问大模型,未来方向是端侧生成模型落地,此前还获得分体电池的可穿戴眼镜专利。
行业动态 IT之家 · 9-29 阅读 23·访客 23