2026.07.01csh0101.ccD5B9D5DVolcano 遇到 OpenEBS LocalPV:一次由 CSINode 误解引出的调度问题记录一次 Volcano 调度 OpenEBS LocalPV PVC 时被 attachable volume capacity 过滤的问题:为什么 openebs.io/local 不出现在 CSINode 是正常的,以及为什么 ignored-provisioners 才是正确修复方向。#Kubernetes#Storage#CSI#OpenEBS#Volcano
2026.06.28csh0101.cc4F4D46B读懂 APISIX Translator:多集群 Pod 到统一网关的一条链路单集群网关问题已经有 Envoy Gateway、Ingress Controller 等成熟答案。APISIX Translator 解决的是多集群场景:把多个 Kubernetes 集群里的 Pod 暴露声明,翻译到集群外的统一 APISIX 网关。#Kubernetes#APISIX#Gateway#Platform Engineering
2026.06.25csh0101.cc13486B2基于 JuiceFS 企业版 Cache Group 的训练数据加速实践:架构篇在边缘训练集群中,用 JuiceFS 企业版 Cache Group、WarmUp CR 和两种挂载方式,为远端对象存储上的训练数据构建百 TB 级缓存能力。#AI Infra#Storage#JuiceFS#Kubernetes
2026.06.24csh0101.cc3C361D8CUDA 深入浅出(七):用 Bypass 和 Offload 总结 GEMM 优化把 Tiling、coalesced load、shared memory layout、register tiling、Tensor Core、TMA 和 WGMMA 放回 bypass 与 offload 两条思路里。#CUDA#GPU#GEMM
2026.06.24csh0101.cc343535CCUDA 深入浅出(六):现代 GEMM Pipeline 的最后一段路从 warp-level tiling 到 Tensor Core MMA、TMA、WGMMA、persistent kernel 和 software pipelining,看现代 CUDA GEMM 怎么把搬运和计算叠起来。#CUDA#GPU#Tensor Core
2026.06.24csh0101.cc77E2CC9CUDA 深入浅出(五):Vectorized Load 和 Shared Memory Layout从 float4 搬运讲起,看 vectorized global load 为什么要配合 shared memory transpose 和 layout 优化。#CUDA#GPU#Vectorized Load
2026.06.24csh0101.cc6E2C7B1CUDA 深入浅出(四):怎么高效访问 Shared Memory从 shared memory bank conflict 讲起,再看 register tiling 怎样让一个线程复用 shared memory 读出的数据。#CUDA#GPU#Shared Memory
2026.06.24csh0101.cc5DDBB2CCUDA 深入浅出(三):什么是 Coalesced Load从 warp 的访问地址开始,看清 coalesced load 为什么会影响 global memory 带宽,以及矩阵乘法里该怎样安排线程和数据。#CUDA#GPU#Memory Coalescing
2026.06.24csh0101.cc129D030CUDA 深入浅出(二):为什么分块可以减少 Global Memory 访问从 naive kernel 的重复读取开始,数清楚 Tiling 怎样把 A、B 的 global memory 访问量从 2T³ 降到 2T²。#CUDA#GPU#Matrix Multiplication
2026.06.24csh0101.cc25B6914CUDA 深入浅出(一):矩阵乘法为什么要分块从一个 T×T 的矩阵乘法小块开始,看清 CUDA GEMM 里 Tiling 为什么能提高数据复用率。#CUDA#GPU#Matrix Multiplication