Sorry, your browser cannot access this site
This page requires browser support (enable) JavaScript
Learn more >

一、一个反直觉的数据 上一篇算过 200 节点 × 30 GB 的账单:制品库带宽被打满、GPU 空转 90 分钟、每次发版蒸发 900 美元。Dragonfly 解决的是"数据从制品库出来"这一段的效率问题。 但有一个更基础的问题一直没人问:这 30 GB,容器启动真的用得到吗? 2016 年 USENIX FAST 会议上,威斯康辛大学的 Harter 团队发表了一篇...

level-trigger OR edge-trigger,谈谈 Kubernetes controller 的开发范式 很多人是从 kubebuilder 的脚手架开始接触 controller 的:kubebuilder init、create api,一个 Reconcile 函数就摆在你面前,照着填就能跑。但填着填着就会冒出一堆问号——为什么 Reconcile 不告诉我"...

工程实践:实现单机 GPU/CPU 混部 这篇文章记录了我们在 GPU 训练机器上实现 CPU 任务混部的完整过程。读完之后,你会了解:GPU 训练任务的数据加载链路(DataLoader → 共享内存 → 锁页内存 → DMA → GPU HBM)中哪些环节对 NUMA 敏感;为什么 Linux 的 First-Touch 内存策略在混部场景下会产生问题,以及如何通过 MPOL_INTE...