尧图网络 高端网站定制 · 原创设计
免费咨询热线
400-888-6620
免费获取方案
【Kubernetes从入门到精通】第48篇:Service的三种代理模式——userspace/iptables/IPVS的前世今生
上一篇【第47篇】NetworkPolicy——你的Pod之间需要防火墙下一篇【第49篇】Cilium——eBPF驱动的下一代K8s网络摘要前面我们一直在说Service负责负载均衡但Service自己不干活——真正把ClusterIP的流量转发到后端Pod的是kube-proxy这个默默无闻的搬运工。kube-proxy其实是个有故事的组件。它经历了三代架构演进userspace最老最慢已经被时代抛弃、iptables现在的主流靠一大堆iptables规则做随机均衡、IPVS新王登基哈希表O(1)转发丰富的调度算法。这篇文章把三种模式掰开揉碎(1)它们的转发链路到底差在哪(2)iptables为什么在大集群会规则爆炸拖垮性能(3)IPVS凭什么又快又灵活(4)怎么一键切到IPVS。读完你就知道为什么生产集群早该上IPVS了。一、kube-proxy在干啥1.1 它的核心职责【kube-proxy 的工作——Service的搬运工】 kube-proxy 在每个Node上都跑一个 │ │ 1. 监听 API Server有什么Service/Pod变化了 │ │ 2. 在Node上落地转发规则 │ • userspace: 起一个proxy进程监听端口 │ • iptables: 写一堆iptables规则 │ • IPVS: 写IPVS虚拟服务器/真实服务器 │ ▼ 用户访问 Service ClusterIP:Port → 被规则拦截 → 转发到某个后端Pod IP:Port要点kube-proxy的本质是个**“监听器规则写入器”**。它自己不转发任何包除了userspace模式而是把转发逻辑安装到内核里iptables/IPVS让内核去做高性能转发。这就是为什么切换模式不影响业务——规则换了个地方存而已。二、三代模式对比2.1 userspace被嫌弃的初代目【userspace 模式——每个包都要敲一次用户态的门】 Pod A ──访问──► ClusterIP:80 │ ▼ iptables 把包 重定向到本机 kube-proxy监听的 随机端口(如 10441) │ ▼ ┌─────────────┐ │ kube-proxy │ ← 用户态进程 │ (选一个后端) │ └──────┬──────┘ │ 再把包发出去 ▼ Pod B (后端) 问题每个包都要内核态→用户态→内核态走两趟 CPU开销巨大延迟高吞吐量上不去userspace模式在K8s 1.0时代是默认的后来因为性能太差1.2就引入了iptables模式替代它现在基本灭绝了。了解它只是为了理解演进史。2.2 iptables现在的主流【iptables 模式——在内核里用规则链做随机均衡】 Pod A ──访问──► ClusterIP:80 │ ▼ KUBE-SERVICES 链 │ ▼ KUBE-SVC-XXXXXX 链 (每个Service一条) │ ┌─────┴──────┐ │ 概率跳转 │ │ 30% → Pod1 │ statistic mode random │ 40% → Pod2 │ 概率 1/剩余权重 │ 30% → Pod3 │ └─────┬──────┘ ▼ KUBE-SEP-YYYYYY (DNAT到具体Pod IP) │ ▼ Pod B / Pod C / Pod D2.3 规则爆炸问题这是iptables模式最致命的软肋【iptables 规则数量随Service/Pod增长——线性爆炸】 Service数 Pod数 近似规则条数 ────────────────────────────────────── 10 50 ~ 几百条 100 500 ~ 几千条 1000 5000 ~ 几万条 ← 开始吃力 5000 20000 ~ 十几万条 ← 灾难 问题 • 每条规则是线性匹配(链表遍历)O(n) • 新增/删除Service要刷新整张表延迟高 • 规则越多kube-proxy同步越慢内存越大要点iptables用的是链表匹配规则是一条条遍历的虽然用了probability做负载分散但整体仍是线性查找。当集群有几千个Service、上万Pod时规则表会膨胀到十几万条不仅占用内存每次更新都要重刷全表延迟明显。这就是为什么大集群要换IPVS。三、IPVS新王登基3.1 哈希表O(1)的威力【IPVS 模式——哈希表直接命中不用遍历】 Pod A ──访问──► ClusterIP:80 │ ▼ IPVS 虚拟服务表 (Hash Map) ┌──────────────────────────┐ │ key: 10.96.0.1:80 │ │ ├─ real server: Pod1 │ ← O(1) 直接查到 │ ├─ real server: Pod2 │ │ └─ real server: Pod3 │ └──────────────────────────┘ │ 按调度算法选一个 (rr / lc / dh ...) ▼ Pod B / Pod C / Pod D维度iptablesIPVS数据结构链表(线性)哈希表(O(1))规则数量影响越大越慢几乎无影响调度算法仅随机概率rr/lc/dh/sh/sed/nq等连接复用一般支持会话保持健康检查无有(real server探测)大规模(1000 svc)❌ 吃力✅ 轻松3.2 IPVS支持的调度算法# 查看当前IPVS调度算法kubectl get configmap kube-proxy-nkube-system-oyaml|grepschedulerName# 默认: rr (轮询)# 支持的算法# rr : round-robin 轮询(最常用)# lc : least-connection 最少连接# dh : destination-hashing 目的地址哈希(同IP总到同Pod)# sh : source-hashing 源地址哈希(会话保持利器)# sed : shortest-expected-delay 最短期望延迟# nq : never-queue 永不排队(直接给空闲服务器)四、实战切到IPVS模式4.1 修改kube-proxy配置# 1. 编辑kube-proxy ConfigMapkubectl edit configmap kube-proxy-nkube-system# 修改# mode: ipvs# ipvs:# scheduler: rr # 可选 rr/lc/dh/sh/sed/nq# strictARP: false# 2. 重启kube-proxy (让配置生效)kubectl rollout restart daemonset/kube-proxy-nkube-system# 3. 验证IPVS规则已生成ipvsadm-Ln# 输出示例# TCP 10.96.0.1:443 rr# - 10.0.0.1:6443 Masq 1 0 0# TCP 10.96.0.10:53 rr# - 10.244.1.3:53 Masq 1 0 0# - 10.244.2.3:53 Masq 1 0 0# ↑ 看到这些虚拟服务就说明IPVS生效了要点切换IPVS要求Node内核加载了ip_vs相关模块。大多数现代Linux发行版都自带但如果你的内核太老或裁减过需要先modprobe ip_vs。另外IPVS模式默认也会保留iptables做MASQUERADE让Pod出网所以别以为切了IPVS就完全没有iptables了——只是Service转发那部分交给IPVS了。本篇小结kube-proxy的三代模式是K8s网络演进的缩影userspace因为每个包都进出用户态太慢被淘汰iptables靠内核规则链做随机均衡成了多年主流但规则线性增长会爆炸IPVS用哈希表O(1)转发多种调度算法轻松应对大集群是现在的生产首选。切IPVS很简单——改kube-proxy的mode为ipvs、重启DaemonSet、用ipvsadm -Ln验证即可。下一篇聊eBPF驱动的Cilium它会把kube-proxy彻底革掉命。上一篇【第47篇】NetworkPolicy——你的Pod之间需要防火墙下一篇【第49篇】Cilium——eBPF驱动的下一代K8s网络
RELATED

相关推荐

微信聊天记录如何永久保存?WeChatMsg 免费导出 HTML、Word、CSV 全攻略

微信聊天记录如何永久保存?WeChatMsg 免费导出 HTML、Word、CSV 全攻略

微信聊天记录如何永久保存?WeChatMsg 免费导出 HTML、Word、CSV 全攻略 【免费下载链接】WeChatMsg 提取微信聊天记录,将其导出成HTML、Word、CSV文档永久保存,对聊天记录进行分析生成年度聊天报告 项目地址: https://gitcode.com/GitHub_T…

📅 2026/9/15 14:10:12
CorfuDB与传统数据库对比:为什么它是分布式系统的未来

CorfuDB与传统数据库对比:为什么它是分布式系统的未来

CorfuDB与传统数据库对比:为什么它是分布式系统的未来 【免费下载链接】CorfuDB A cluster consistency platform 项目地址: https://gitcode.com/gh_mirrors/co/CorfuDB 在当今数据爆炸的时代,分布式系统已成为处理海量数据和高并发请求的核心架…

📅 2026/10/8 2:29:40
RabbitMQ 全套复盘 + Nacos+ES+MyBatis-Plus 梳理

RabbitMQ 全套复盘 + Nacos+ES+MyBatis-Plus 梳理

RabbitMQ 消息队列(异步通信、可靠性全套解决方案)在短信项目里:上万条批量营销短信不会直接同步调用第三方通道,而是先丢进 MQ,消费者慢慢消费,防止瞬间流量打垮服务。RabbitMQ 核心组成组件1.生产者 Prod…

📅 2026/9/9 14:51:09
MORE NEWS

更多资讯

📰

螺栓销钉缺失检测:1209张VOC数据集与YOLOv8训练实践

简介:输电线路螺栓销钉缺失检测图像数据集专注电力设施智能巡检场景,面向计算机视觉研究者与电力运维开发人员,旨在解决销钉缺失这一高危隐患的自动识别问题。数据集共2000个文件、约89.52MB,包含791张高清JPEG巡检图像及1209个PA…

📰

AI知识简记(持续更新):用TaoToken统一Key打通VS Code与Cursor的大模型调用

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

📰

信用风险预测模型实战:从标签定义、WOE特征工程到评分卡转换

简介:这份PDF是一篇基于机器学习算法的商业银行信用风险预测模型研究论文,适合金融科技、风控建模方向的从业者、研究生及竞赛选手参考。文章从信用风险研究的现实背景切入,系统梳理了多元判别分析、Logistic回归等传统统计方法,以…

📰

强激光大气热晕效应相位屏建模与MATLAB仿真实现

简介:基于MATLAB的热晕相位屏仿真程序包,面向光学系统与大气传输研究场景,帮助科研人员和工程师模拟高能激光、望远镜等系统中由大气温度不均匀引发的波前畸变。压缩包共13个文件,包括7个.m脚本、4个.bmp图像、1个.asv临时备份和1…

📰

航拍滑坡数据集4315张VOC+YOLO双格式

简介:本资源为面向遥感图像目标检测任务的航拍滑坡检测专用数据集,适用于计算机视觉方向的研究者、地质灾害智能识别初学者及深度学习模型训练实践者。数据集共4315张512512分辨率航拍图像,全部标注单类别“landslide”,含对应VOC…

📰

程序员数学知识地图:概率统计线代离散图论速查与Python验证

简介:《程序员的数学系列》PPT 面向程序员及需要应用数学知识的技术工作者,系统梳理编程中高频使用的数学基础,帮助读者在算法设计、数据处理与问题建模时补齐理论短板。内容覆盖概率论、统计学、线性代数、离散数学与图论五大板块&#xff0…

TODAY

今日更新

THIS WEEK

本周精选

THIS MONTH

本月热门

读完文章,想聊聊您的网站?

告诉我们您的行业与需求,资深顾问一对一梳理方案与报价,全程免费。

📞 💬