<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>高可用 on SRE &amp; AI 实践录</title><link>https://sre-ai-blog.pages.dev/zh/tags/%E9%AB%98%E5%8F%AF%E7%94%A8/</link><description>Recent content in 高可用 on SRE &amp; AI 实践录</description><generator>Hugo</generator><language>zh-CN</language><lastBuildDate>Sun, 26 Jul 2026 01:29:48 +0800</lastBuildDate><atom:link href="https://sre-ai-blog.pages.dev/zh/tags/%E9%AB%98%E5%8F%AF%E7%94%A8/index.xml" rel="self" type="application/rss+xml"/><item><title>Kubernetes 集群高可用与故障自动愈合实践</title><link>https://sre-ai-blog.pages.dev/zh/posts/kubernetes-ha/</link><pubDate>Thu, 25 Jun 2026 00:00:00 +0000</pubDate><guid>https://sre-ai-blog.pages.dev/zh/posts/kubernetes-ha/</guid><description>&lt;h2 id="一控制面多活部署"&gt;一、控制面多活部署&lt;/h2&gt;
&lt;p&gt;Kubernetes 控制面的高可用是所有上层服务稳定的基石。我们采用三节点多活部署模式，通过负载均衡器分发 API Server 请求，etcd 集群以 Raft 协议保证数据一致性。&lt;/p&gt;
&lt;h2 id="二etcd-集群调优"&gt;二、etcd 集群调优&lt;/h2&gt;
&lt;p&gt;etcd 是集群状态存储的核心，其性能直接关系到集群恢复速度。实践中我们将 etcd 的数据目录部署在 NVMe SSD 上，调整 &lt;code&gt;--quota-backend-bytes&lt;/code&gt; 至 8GB，并开启客户端侧压缩。&lt;/p&gt;</description></item></channel></rss>