搜索:DRA

共命中 2 条(服务端检索)
Kubernetes 怎么把 GPU 分给容器:Device Plugin、GPU Operator 与共享三路线
GPU 在 Kubernetes 里是「整数个的扩展资源」,一块 H100 跑一个小推理服务就是浪费。本文拆解 Device Plugin 汇报机制、GPU Operator 的组件分工,对比时间片、MIG、MPS 三条共享路线的隔离性与适用场景,并展望 1.34 起 GA 的 DRA 会怎么改玩法。
原创 后端技术 精选 · 原创 · 2天前 阅读 4·访客 3
Kueue 与 AI 批任务调度:在 Kubernetes 上给训练作业排队、记账与抢占
8 张 GPU 卡的需求、只有 5 张的库存,AI 批任务在裸 Kubernetes 上只有「挂起等人工」一条路。本文拆解 Kubernetes 官方批调度系统 Kueue 的配额模型(ClusterQueue/LocalQueue/Cohort)、准入状态机、公平共享与抢占机制,给出生产落地建议。
原创 后端技术 精选 · 原创 · 2天前 阅读 5·访客 5