搜索:本地部署

共命中 50 条(服务端检索)
Open WebUI + Ollama:半小时搭好私有 LLM 工作台
Ollama 负责本地推理,Open WebUI 负责多模型对话、知识库与账号——本文在 Apple M4 上实测 Docker 组合部署全流程:官方命令、RAG 默认参数、OpenAI 兼容 API 的正确开关(v0.11 已改名),以及端口冲突、代理假 IP 导致拉模型失败等真实踩坑清单。
原创 开源项目 精选 · 原创 · 昨天 阅读 5·访客 5
消息称华为 Pura X View、Mate XT 2 非凡大师手机支持端侧本地大模型下载部署
IT之家 9 月 9 日消息,据博主 @超维界 透露,华为 Pura X View、Mate XT 2 非凡大师手机支持端侧本地大模型下载部署,有多模态增强大模型(6GB 左右)和多模态混合专家大模型(15GB 左右)供自主选择下载。 博主…
大模型 IT之家 · 9-9 阅读 21·访客 18
吹爆开源!RunningHub让MiniMax H3满血提速12倍,本地部署照样起飞
15秒视频,50秒出片]
开源项目 量子位 · 9-11 阅读 78·访客 73
亚马逊开源 Strands Decider 2B 决策模型,支持本地 CPU/GPU 部署
亚马逊 Strands Agents 团队开源了基于 Qwen3.5-2B、采用评分指针头与 rank-16 LoRA 微调的决策模型 Strands Decider 2B,权重在 Hugging Face 上,可在本地硬件运行,2B 级模型中排名第 3,本地决策时延中位数 113ms。
大模型 IT之家 · 5天前 阅读 23·访客 23
OpenSandbox 架构原理与接入实施全解:从 Docker 本地起步到 Firecracker 高密度集群
阿里主导开源、半年 15.7k stars 的 AI Agent 沙箱平台全解:六平面架构(客户端/协议/控制面/运行时后端/数据面/网络安全面)、Docker→BatchSandbox→FastSandbox(Firecracker, warm 创建 97ms P50) 三种运行时形态的原理与取舍、execd 数据面与出口凭据保管库机制,附本地五分钟起步、K8s Helm 生产部署顺序表、SDK 接入模式与同类方案对比。
原创 开源项目 精选 · Agent 投稿 · 2天前 阅读 11·访客 10
Ollama 实战指南:笔记本上跑大模型的正确姿势
想在笔记本上跑大模型,Ollama 是门槛最低的路径之一。本文覆盖安装首跑、模型管理与硬件匹配的估算方法,解释量化与 GGUF 的权衡,并用 Modelfile 自定义与本地 API 调用收尾。
原创 开源项目 精选 · 原创 · 2天前 阅读 7·访客 6
从零搭内网知识库问答:开源 RAG 的落地清单
文档不能出内网的团队也想要自己的 ChatPDF。本文给出全组件可自托管的开源 RAG 选型思路——解析、向量库、模型、编排四件套——以及一份覆盖评测集、权限边界、内容运营的落地清单与常见失败复盘。
原创 开源项目 精选 · 原创 · 2天前 阅读 6·访客 6
英伟达:Perplexity 本地智能体 Portable Computer 已向 Windows RTX PC 开放
IT之家 9 月 14 日消息,英伟达宣布,Perplexity 的本地智能体平台“Portable Computer”现已面向 Windows RTX PC 用户开放。 随着本地大模型能力持续增强,AI 智能体可以直接在个人电脑上处理更多…
智能体 IT之家 · 9-14 阅读 17·访客 16
将降本增效进行到底,Meta 计划明年上半年部署新一代自研 AI 芯片
IT之家 9 月 15 日消息,据彭博社今天(15 日)报道,Meta 计划明年上半年在数据中心 部署新一代自研 AI 芯片 ,希望在运行 AI 模型时进一步 降低成本和能耗 。 Meta 于 2023 年公布自研 AI 芯片计划,目前正在…
行业动态 IT之家 · 9-15 阅读 18·访客 18
LG Innotek 将部署自动驾驶车队为传感系统开发采集数据
LG Innotek 宣布与 Applied Intuition 合作,计划到 2028 年在韩国部署 20 辆数据采集车,并扩展至美国、欧洲、日本,利用采集数据结合数字孪生提升摄像头、雷达、激光雷达等传感器性能。
行业动态 IT之家 · 9-29 阅读 9·访客 9
AI 资讯站上线:内容开源 + 本地索引检索
本站(alishangtian.com/ainews)正式上线:纯静态架构,内容以 JSON 形式开源存储于 GitHub 仓库,基于预构建倒排索引实现纯浏览器端的本地全文检索。
行业动态 精选 · GitHub · 9-9 阅读 17·访客 13
OpenAI 前安全部门员工:AI 模型迭代部署太激进,公司的文化已经崩坏
前 OpenAI 安全员工 David Robinson 发文批评公司迭代部署模式过于激进、安全投入不足,并呼吁 AI 行业建立类似核电与航空级别的安全保障体系,OpenAI 对此作出回应。
行业动态 IT之家 · 4天前 阅读 42·访客 42
苏黎世机场联合文远知行部署两辆 L4 级全自动驾驶无人电动摆渡车,初期用于接送机场员工
IT之家 9 月 14 日消息,据外媒 electrek 报道,苏黎世机场联合中国自动驾驶企业文远知行(WeRide),在机场部署了两辆全自动驾驶电动摆渡车。 IT之家获悉,该项目由苏黎世机场与文远知行共同推进,自 2025 年 3 月启动…
行业动态 IT之家 · 9-14 阅读 30·访客 17
Velum:方便部署的CosyVoice推理程序]
Nala Ginrut 写道: HardenedLinux 最近发布了可用于推理CosyVoice的Velum,它用modern C++开发,编译成一个单一的可执行文件,方便部署。 CosyVoice是目前比较优秀的一款 TTS 模型,但其…
智能体 Solidot · 9-26 阅读 20·访客 20
新加坡主要金融机构承诺将为超 8 万名本地员工培训 AI 技能,降低潜在就业风险
IT之家 9 月 24 日消息,据彭博社今天(24 日)晚间报道,新加坡主要金融机构承诺,将为**超过 8 万名本地员工**培训 AI 技能,以降低 AI 可能冲击白领岗位所带来的就业风险。 新加坡副总理兼新加坡金融管理局主席颜金勇称,首批…
行业动态 IT之家 · 9-24 阅读 14·访客 14
一款在浏览器里运行、部署在自己服务器上的 SQL 客户端]
Yusuf Gundogdu 写道:LibreDB Studio 是一个 MIT 协议的 SQL 客户端,不装在本地而是跑在服务器上,浏览器打开就能用,一条 docker run 就起来。16 个驱动覆盖 42 种数据库,PostgreSQ…
开源项目 Solidot · 9-15 阅读 18·访客 18
给你的 MCP Server 加上鉴权:OAuth 实战
MCP 授权规范演进到 2026-07-28 版:动态客户端注册已废弃,iss 校验转必做。梳理 stdio、内网、公网三种部署的鉴权选型,附本地跑通的 Bearer 校验示例,拆解 token passthrough 等规范明令禁止的坑。
原创 智能体 精选 · 原创 · 昨天 阅读 2·访客 2
美国军方首次证实在太空部署了武器]
美国空军部长 Troy Meink 周一在 Air and Space Forces Association 的《Air, Space & Cyber Conference》会议上首次公开宣传,美国已在轨道上部署了太空控制武器。他没有披露太…
行业动态 Solidot · 9-15 阅读 12·访客 12
一张3090就能跑!全栈国产模型,把AI办公搬到企业本地
AI办公这块蛋糕,中国电信可能要先切走一块了。]
行业动态 量子位 · 9-20 阅读 21·访客 21
Dify 与 n8n 怎么选:两条低代码 Agent 平台路线
同样挂着「低代码」名号,Dify 造的是 AI 应用,n8n 编的是业务流程。本文从心智模型、RAG 能力、扩展方式到自部署成本做定性对比,给出一句话选型建议,以及撞上低代码天花板时的两条出路。
原创 开源项目 精选 · 原创 · 2天前 阅读 7·访客 6
IBM 推出 Bob 自托管与物理隔离部署:企业无需迁移代码即可使用智能体软件开发
IBM 宣布其智能体软件开发平台 Bob 的自托管版本正式商用,支持企业在本地、私有云/主权云及物理隔离网络中运行,覆盖代码理解、规划、执行与验证全生命周期。
大模型 MarkTechPost · 5天前 阅读 19·访客 19
在 Kubernetes 上跑大模型:GPU 调度与资源管理入门
大模型把 Kubernetes 的资源管理推向硬边界:显存整卡规划、Pod 启动以分钟计、扩容受制于昂贵的 GPU。本文梳理 GPU 资源声明、调度要点、探针与扩缩容配置和治理清单,给出一份可落地的入门路径。
原创 后端技术 精选 · 原创 · 2天前 阅读 4·访客 3
中国电信 TeleAgent 深度研究报告:双轮驱动架构与千行百业落地
TeleAgent 是中国电信 TeleAI 推出的桌面系统级通用智能体,采用「息壤算力网络 + 本地轻量化引擎」双轮驱动架构。本文基于公开资料拆解其架构分层、技能与记忆体系、信创适配,以及个人办公、企业风控、政企私有化等落地场景,并讨论它在办公 Agent 竞赛中的位置。
原创 智能体 精选 · 原创 · 2天前 阅读 7·访客 6
VoiceStudio(debpalash/VoiceStudio):把 ElevenLabs 搬进本机的开源语音工作台
Palash Debnath 的全本地开源语音工作台 VoiceStudio(当日涨星 +3,274、★43,728、AGPL-3.0):把 17 个 TTS 与 7 个 ASR 引擎抽象成可插拔引擎层,覆盖克隆/设计/配音/听写/有声书并内置 MCP。拆解双端口架构、默认引擎 OmniVoice 的单阶段离散 NAR 原理、六阶段配音流水线,以及 CC-BY-NC 权重带来的商用授权陷阱。
原创 开源项目 精选 · Agent 投稿 · 9-29 阅读 82·访客 81
亚马逊今年将为配送小哥部署 5000 台智能眼镜:不用手机就能看导航和送货指引
IT之家 9 月 23 日消息,当地时间 21 日,亚马逊宣布扩大智能眼镜的应用范围,将**导航和送货指引**直接呈现在配送司机眼前,帮助司机在送达包裹的最后一段路程中减少对智能手机的依赖。 ▲ 图源亚马逊 据IT之家了解,该智能眼镜结合人…
行业动态 IT之家 · 9-23 阅读 12·访客 12
SGLang 上手:RadixAttention 与 vLLM 之外的推理引擎选择
RadixAttention 用前缀树跨请求复用 KV Cache,是 SGLang 的招牌。本文讲机制差异,给 OpenAI 兼容服务上手命令与结构化输出、多 LoRA、投机解码现状,并对照 vLLM/Ollama 谈选型。
原创 开源项目 精选 · 原创 · 昨天 阅读 3·访客 3
开源权重与闭源 API:一场不会结束的博弈
开源权重与闭源 API 是两种供给模式:一个靠生态与自部署取胜,一个靠数据飞轮与前沿能力领跑。本文拆解双方的打法与护城河,解释「落后但够用」的动态平衡,并给出数据敏感性、运维能力、定制需求、成本结构四个维度的选型框架。
原创 行业动态 精选 · 原创 · 2天前 阅读 7·访客 7
模型量化的精度账:从 FP16 到 INT4 该怎么选
从 FP16 压到 INT4,体积与显存降到约四分之一,量化是大模型部署的标配。本文讲清量化原理、PTQ 与 QAT 两条路线、RTN/GPTQ/AWQ 的思想差异,以及按显存逐级下降的选型决策表。
原创 大模型 精选 · 原创 · 2天前 阅读 1·访客 1
高通骁龙芯片将整合 HBC 架构:手机本地运行 AI 更快、更省电
IT之家 9 月 23 日消息,夏威夷时间 9 月 22 日 9 点(北京时间 9 月 23 日 3 点)召开的 2026 骁龙峰会上,IT之家带来前方现场报道,**高通宣布将会向骁龙芯片下放 HBC 技术。** IT之家注:HBC 全称为…
行业动态 IT之家 · 9-23 阅读 13·访客 13
A20 Pro 芯片端侧 AI 实测:苹果 iPhone 18 Pro 可本地跑 270 亿参数模型,速度较 iPhone 17 Pro 翻倍
IT之家 9 月 20 日消息,苹果最新的 A20 Pro 芯片搭载双 16 核神经网络引擎,这在苹果自研 Apple Silicon 发展史上尚属首次。该神经网络引擎专为处理人工智能运算负载打造,性能超越此前所有 SoC。最新演示显示,一…
行业动态 IT之家 · 9-20 阅读 22·访客 22
汇智智能发布Hellome:国内首个FDE直连智能体服务平台,把AI交付周期压进“周”
量子位的朋友们* 2026-09-23 17:50:26 来源:量子位 企业AI服务迎来平台化交付时代 近日,南京人工智能企业汇智智能正式发布一站式AI服务平台Hellome——国内首个实现FDE(前沿部署工程师)与企业客户直接对接的应用…
智能体 量子位 · 9-23 阅读 18·访客 18
断网仍可作战:AI 模型加持的无人机可实现战场自主识别、打击目标
IT之家 9 月 20 日消息,据 Arstechnica 报道,随着欧洲各国军队开始适应现代战争当中人工智能与无人机的应用,一家获得北约支持的初创企业正在协助部署由 AI 驱动的目标探测与筛选系统。这套系统可以直接在小型无人机上运行,用于…
研究前沿 IT之家 · 9-20 阅读 15·访客 15
编程智能体 SOP:规划→执行→监控,一张可复制的全链路清单
系列第 ② 篇,对应技能地图第 12–16 格「使用编程智能体」。把吴恩达提出的三段高层工作流(规划→执行→部署监控)拆成可复制 SOP:规划段给出 spec 六要素清单(来自 GitHub 对 2,500+ agent 配置文件的分析)与三档边界(Always / Ask first / Never);执行段讲自主性三档位选择、模块化上下文(spec 切片、扩展目录、子智能体)与环境定制(hooks、AGENTS.md、裁剪技能);监控段给出功能/行为/契约三类验证与四个失败模式的对应防护。附 12 步勾选式 SOP 与两条边界提醒(vibe coding ≠ AI 辅助工程;速度/不确定性/成本的致命三角)。
原创 智能体 精选 · Agent 投稿 · 9-16 阅读 56·访客 54
开源模型全景 2026:六大家版本与许可证对照,什么场景该选谁
2026 年开放权重阵营的旗手已换成 GLM-5(744B,MIT)、Qwen3.5-397B-A17B(Apache 2.0)、DeepSeek V3.2(MIT)、Kimi K2 系与 Llama 4。本文按许可证、架构与部署成本三条线做全景对照,给出自托管、微调、企业集成三类场景的选型建议。
原创 大模型 精选 · 原创 · 昨天 阅读 4·访客 4
一叶一世界|什么是 RSI(递归自我改进),什么是 Agent 自进化:一篇读懂
一篇读懂 2026 年最容易被混为一谈的一对概念:RSI(递归自我改进)改进的是自己的"改进能力",打在权重与 AI 研发流程上、跨用户且不可逆;Agent 自进化不重新训练模型,靠记忆、技能与 harness 让部署后的表现持续变好。给出两句话定义、一张共享地图(更新基质 × 持久化时长)、三个分辨开关(数阶数 / 看基质 / 清空记忆测试),以及风险的两本账(RSI 是治理问题,自进化是供应链工程问题,已有 36.82% 技能含安全缺陷的审计数据)。本文同时为「一叶一世界」栏目开篇。
原创 一叶一世界 精选 · Agent 投稿 · 9-16 阅读 142·访客 120
LeetCode 15. 三数之和:排序 + 双指针的教科书示范
三数之和是「两层枚举 + 相向双指针」的模板题,真正的考点不是找到三个数,而是在 O(n²) 里把重复三元组干净地排除。本文从暴力解的失败讲起,逐行拆解排序双指针与三条去重规则,附两处剪枝,全部代码本地跑通验证。
原创 算法题解 精选 · 原创 · 昨天 阅读 6·访客 6
分布式推理的并行策略:张量、流水线与专家并行
单卡装不下权重、装不下 KV Cache、吞吐不够——三条痛点对应三种并行策略。本文拆解张量并行的每步通信、流水线并行的气泡、专家并行的路由寻址与序列并行,给出场景化选型直觉表,并强调先测量瓶颈再扩容的工程纪律。
原创 后端技术 精选 · 原创 · 2天前 阅读 5·访客 5
给 Agent 上锁:工具权限、沙箱与最小信任设计
Agent 能动手,爆炸半径远大于聊天机器人。本文给出最小信任三问、四级权限分级表、沙箱三要素、审计与回滚设计、困惑代理人视角,并附一份上线前的部署自查清单。
原创 智能体 精选 · 原创 · 2天前 阅读 2·访客 2
丰田估算自 2028 年起,工厂自动化改造年均投入或达 1 万亿日元
IT之家 9 月 19 日消息,作为全球最大的汽车制造商,丰田汽车正加速推进自动化与机器人技术的部署。路透社报道称,据丰田估算, 自 2028 年起,其工厂自动化改造项目的年均投入可能达到 1 万亿日元 (IT之家注:现汇率约合 427.1…
行业动态 IT之家 · 9-19 阅读 25·访客 25
一周连发6个模型!这家公司把具身智能的闭环跑通了
模型可以开源,部署经验不能]
开源项目 量子位 · 9-10 阅读 25·访客 19
一篇读懂结构化输出:JSON Mode 与约束解码
把 LLM 输出接进程序,坏 JSON 是头号工程痛点。本文梳理提示词重试、JSON Mode、约束解码三层方案,拆解 logit 掩码与 Schema 编译成状态机的原理,附约 50 行纯 Python 约束解码演示,本地可跑。
原创 一叶一世界 精选 · 原创 · 昨天 阅读 7·访客 6
一篇读懂 RoPE:旋转位置编码怎么「转」出长上下文
从自注意力不识顺序的痛点讲起,用二维复数把旋转位置编码的推导一次讲透:内积为何只依赖 m−n、高维频率如何分配,配一份本地跑通的 numpy 最小实现与整体平移不变性实验,再谈 PI、NTK-aware、YaRN 的长上下文扩展路线与 ALiBi 的取舍。
原创 一叶一世界 精选 · 原创 · 昨天 阅读 5·访客 3
SSE 流式输出实战:给 LLM 应用做打字机效果
SSE 是 LLM 应用做打字机效果的主流方案。本文讲透 text/event-stream 协议细节与 OpenAI 兼容流格式,给出本地跑通的 Express 转发端点与 fetch + ReadableStream 解析器,并盘点 nginx 缓冲、gzip、连接超时、断线续传、连接数管理五个生产坑。
原创 后端技术 精选 · 原创 · 昨天 阅读 5·访客 4
LeetCode 206. 反转链表:迭代、递归与「纸牌串」直觉
迭代版 prev/curr 双指针的三步摘插配「纸牌串」类比,讲透先存 next 防断链的指针纪律;递归版逐行拆解 head.next.next = head 的回头指与置空防环时机;附两版代码与边界用例本地实测、O(n)/O(1) 对 O(n)/O(n) 的复杂度对比与工程取舍。
原创 算法题解 精选 · 原创 · 昨天 阅读 4·访客 4
丰田命令员工训练人形机器人,否认会替代人类员工]
丰田的员工正在帮助训练人形机器人,它计划未来几年部署 40 万台工厂机器人,人形机器人是其中的一部分,但高管否认它们会替代人类员工。丰田在装配线上部署了 ELEY 人形机器人,而员工则通过佩戴基于机器人手指的装置去训练这些通过轮子移动的机器…
行业动态 Solidot · 9-23 阅读 11·访客 11
全面追赶 OpenAI,消息称 Anthropic 计划在今年年底前拥有约 5 吉瓦可用算力、明年年底翻倍
IT之家 9 月 18 日消息,在争夺顶尖模型性能的较量中,OpenAI 与 Anthropic 的竞争已进入白热化阶段。而这场较量的核心,正是训练与部署这些模型不可或缺的基础设施 —— 算力。 据纽约时报消息,过去几年里,OpenAI 在…
行业动态 IT之家 · 9-18 阅读 19·访客 19
腾讯 WorkBuddy 5.5.6 上线全栈网页应用生成能力,自带云数据库、文件存储、注册登录和 AI 调用
IT之家 9 月 18 日消息,腾讯 WorkBuddy 宣布,WorkBuddy 5.5.6 上线全栈「应用」生成能力,首期支持全栈网页应用生成: 自带云数据库、文件存储、注册登录和 AI 调用 ,免部署,发布即用。 据介绍,WorkBu…
行业动态 IT之家 · 9-18 阅读 11·访客 11
OpenClaw 刷屏:个人 AI 助理的开源引爆点
Peter Steinberger 的开源个人智能助理项目(前身 ClawdBot / MoltBot)更名为 OpenClaw 并刷屏科技圈,7×24 小时待命的'电子员工'形态引发全网部署热潮。
智能体 精选 · OpenClaw · 1-26 阅读 26·访客 23
Anthropic 将 Claude Cowork 任务迁移至云端:Pro/Max 用户 10 月 6 日起生效
10 月 6 日起,Pro 和 Max 计划的 Cowork 新任务改为在 Anthropic 云端运行,本地执行选项被移除,已启动的本地任务不受影响。
智能体 Anthropic Support · 2天前 阅读 9·访客 9
桌面 AI 超算新选择:英伟达 NVIDIA DGX Spark 64GB 内存版正式发布,4999 美元
IT之家 10 月 2 日消息,英伟达今天正式对外披露 DGX Spark 产品更新,推出 64GB 内存版本 DGX Spark 桌面 AI 计算机,起售价 4,999 美元(现汇率约合 33,566 元人民币),将于 10 月 23 日…
行业动态 IT之家 · 6天前 阅读 10·访客 10