跳至主要內容
程序厨
🌟项目实战
全部项目
C++ 项目
1. 高性能日志
2. 内存检测工具
3. 高性能 RPC 框架
4. 埋点 SDK
5. 音视频播放器
6. C++20 机器人 Runtime
7. mini-llama.cpp 推理引擎
Agent 项目
1. 飞书知识库 RAG Agent
2. 代码 PR Agent
😊算法基地
1. 数据结构
2. 字符串匹配
3. 二叉树
4. 排序算法
5. 排序算法秒杀题目
6. 数组篇
7. 链表
8. 求和问题
9. 求次数问题
10. 双指针问题
11. 栈和队列
12. 二分查找及变种
13. 单调队列单调栈
14. 前缀和
15. 递归
16. 动态规划
17. 回溯
18. 基础知识
19. 缓存淘汰算法
20. 图相关
21. 深搜广搜
22. 哈希表相关题目
🌟面试基地
1. C++ 面试题
2. Redis
3. MySQL
4. 计算机网络
5. 操作系统
🤖AI 学习
1. 图解深度学习与大模型
2. AI Infra
😄C++学习基地
1. C语言基础
2. C++基础
3. C++ 进阶
📚校招指南
1. 学习路线
2. 大厂面经
3. 面试指南
4. 心得感悟
5. 优质项目
6. 实用工具
搜索
S
Infra
厨子
小于 1 分钟
目录
AI Infra 常用算子:GEMM、Softmax 与 Attention 入门
AI Infra 推理知识体系:从请求生命周期到容量规划
AI Infra 高频面试题:推理瓶颈、缓存与并行策略
BPE 与 WordPiece:大模型 Tokenizer 编码原理
Chunked Prefill 原理:LLM 调度、延迟与吞吐权衡
CUDA 与 Triton 学习导览:硬件、编程与分析工具
CUDA 性能分析:Nsight、Graph、Stream 与 CUTLASS
CUDA 硬件基础:GPU 存储层次与 Hopper 架构
CUDA 编程优化:合并访存、Bank Conflict 与 Tiling
Decode 显存带宽估算:权重、KV Cache 与 Batch
DP 与 DPA 的区别:SGLang 并行部署与路由
FlashAttention V1 到 V4:分块、在线 Softmax 与演进
GQA 与 MQA 原理:注意力结构如何影响 KV Cache
KV Cache 容量与使用率:延迟、吞吐及稳定性
KV Cache 显存使用率:OOM、排队与尾延迟风险
KV Cache 显存计算:注意力布局与 DeepSeek 示例
PD 分离中的 KV Cache:利用率与 Router 负载均衡
PD 分离数据流:KV 生成、传输与 Decode 交接
Prefill FLOPs 估算:模型线性计算与 Attention 成本
SGLang DP 调度源码:Controller 与负载均衡策略
SGLang 源码分析:Chat Completions 请求全链路
Triton 入门教程:Block 编程模型与算子实现
TTFT 排查手册:首字延迟拆解、观测与优化
图解推理并行策略:DP、TP、SP、CP、EP 与 CPP
图解模型推理的八种集合通信原语
大模型推理性能估算:显存、吞吐与容量规划
大模型结构与推理工程:从配置到 SGLang 热路径
投机解码端到端解析:EAGLE、接受判定与调优
模型 config.json 解析:MLA、MoE、MTP 与量化
滑动窗口注意力 SWA:KV Cache 与长上下文推理
上一页
1. 图解深度学习与大模型
下一页
2. 模型结构与编码
☰
收起
🌍️
网站反馈
备注你遇到的问题
😄
公众号
手机阅读
💰
支持作者
一颗糖就好
👥
26届校招群
备注:年级-技术栈
⬆️
顶部