主流激活函数原理与演进详解:从 Sigmoid 到 SwiGLU
从 Sigmoid/Tanh 到 ReLU 家族,再到 GELU/SiLU 和当前 LLM 标准 SwiGLU,全面梳理激活函数的演进脉络、数学原理与工程实现。
从 Sigmoid/Tanh 到 ReLU 家族,再到 GELU/SiLU 和当前 LLM 标准 SwiGLU,全面梳理激活函数的演进脉络、数学原理与工程实现。
全面解析 LLM 量化:数据类型基础、对称/非对称量化数学、GPTQ Hessian 误差补偿、AWQ 激活感知缩放、SmoothQuant 激活平滑、FP8 与 GGUF 量化体系。
对比 vLLM 和 SGLang 的调度策略:FCFS、优先级调度、LPM 最长前缀匹配、抢占机制、Token Budget 分配与 Chunked Prefill。
解读 AAAI 2024 论文,MinionsRL 利用 Serverless 计算实现更低成本、更快速的分布式深度强化学习训练。
以 DeepSeek-V2-Lite 为例,详细拆解 MoE 的每个参数含义、Router 路由决策、Token Permutation、Grouped GEMM、共享专家计算、MLA 注意力压缩与多 GPU 并行策略。
解读 VLDB 2025 论文,Nitro 通过 Serverless 计算提升分布式强化学习的性能与资源效率。
深度解读 OSDI 2014 经典论文,Parameter Server 如何解决大规模分布式机器学习的参数同步与通信问题。
解读 RLHFless 论文,将 Serverless 计算引入 RLHF 训练流程,实现更高效的资源利用与成本优化。
解读 ICML 2018 论文,RLlib 基于 Ray 框架提供分布式强化学习的通用抽象,支持多种 RL 算法的高效并行训练。
从二维旋转直觉到高维推广,详解 RoPE 的数学原理、NeoX/GPT-J 两种实现风格、Triton GPU Kernel 优化,以及 Linear Scaling / NTK / YaRN 三种长度外推策略。