<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>GPU on SRE &amp; AI 实践录</title><link>https://sre-ai-blog.pages.dev/zh/tags/gpu/</link><description>Recent content in GPU on SRE &amp; AI 实践录</description><generator>Hugo</generator><language>zh-CN</language><lastBuildDate>Sun, 26 Jul 2026 01:29:48 +0800</lastBuildDate><atom:link href="https://sre-ai-blog.pages.dev/zh/tags/gpu/index.xml" rel="self" type="application/rss+xml"/><item><title>LLM Infra 搭建与 GPU 集群性能调优</title><link>https://sre-ai-blog.pages.dev/zh/posts/llm-gpu-infra/</link><pubDate>Wed, 22 Jul 2026 00:00:00 +0000</pubDate><guid>https://sre-ai-blog.pages.dev/zh/posts/llm-gpu-infra/</guid><description>&lt;h2 id="一推理基础设施选型"&gt;一、推理基础设施选型&lt;/h2&gt;
&lt;p&gt;部署大语言模型推理服务，性能与成本是首要考量。vLLM 凭借 PagedAttention 显存管理机制，相比传统方案提升 2-4 倍吞吐量，成为我们的首选推理引擎。&lt;/p&gt;
&lt;h2 id="二vllm-分布式部署"&gt;二、vLLM 分布式部署&lt;/h2&gt;
&lt;p&gt;对于 70B 以上参数的模型，单卡显存无法满足需求。我们采用 Tensor Parallelism 将模型拆分到 4 张 A100-80G 上，并配合 Ray 实现弹性扩缩容。&lt;/p&gt;
&lt;h2 id="三gpu-显存优化策略"&gt;三、GPU 显存优化策略&lt;/h2&gt;
&lt;p&gt;除 vLLM 本身的优化外，我们还启用了 FlashAttention-2、量化推理（FP8/INT4）以及 Continuous Batching，将单卡吞吐量从 1200 tokens/s 提升至 4800 tokens/s。&lt;/p&gt;</description></item></channel></rss>