docker swarm 集群故障与异常详解
本文介绍了docker swarm 集群故障与异常详解,分享给大家,具体如下:
在上次遭遇 docker swarm 集群故障后,我们将 docker 由 17.10.0-ce 升级为最新稳定版 docker 17.12.0-ce 。
前天晚上22:00之后集群中的2个节点突然出现CPU波动,在CPU波动之后,在凌晨夜深人静、访问量极低的时候,整个集群出现了故障,访问集群上的所有站点都出现了502,过了一段时间后自动恢复正常。
ECS实例:swarm1-node5,CPU百分比于00:52发生告警,值为96.14%,持续时间0分钟
。。。
昨天早上发现访问部分节点中的容器应用响应有些慢,于是我们通过阿里云控制台强制重启这些节点后恢复正常。
今天上午我们在集群上更新一个应用时(部署新的镜像),出现了奇怪的问题。应用是在 swarm1-node1 这个 manager 节点上部署的,部署后容器运行在其他节点上,但奇怪的是只有在 swarm1-node1 这个节点上可以正常访问容器中的站点,在其他节点上访问都是 503 ,用 docker stack rm 命令删除应用并重新部署问题依旧。
当时 docker-flow-proxy(路由应用) 的 2 个容器都是部署在 swarm1-node1 节点上的,从问题现象看,在 swarm1-node1 节点上 docker-flow-proxy 容器与外界的通信正常,docker-flow-proxy 容器与其他节点上的容器的 overlay 网络(网络A)通信正常;在其他节点上,外界的请求通过 overlay 网络(网络B)被正常转发到 docker-flow-proxy 容器,却不能被正常路由到其他节点上对应的容器(也是通过 overlay 网络A)。对这个奇怪现象实在想不通,但是问题摆在那,想不通也要解决。想不通背后的原因,那我们换个角度,其他节点都异常,就 swarm1-node1 正常,根据少数服从多数的粗暴原则,那就认为swarm1-node1 不正常吧。于是通过下面的命令将swarm1-node1 节点下线:
docker node update --availability drain swarm1-node1
swarm1-node1 下线后,其他节点都恢复了正常,果然是 swarm1-node1 不正常。
swarm1-node1 下线的背后是 docker-flow-proxy 容器换到其他节点上运行。
问题就这样被猜测解决了。
以上就是本文的全部内容,希望对大家的学习有所帮助,也希望大家多多支持脚本之家。
您可能感兴趣的文章:
- Docker构建ELK Docker集群日志收集系统
- 详解从 0 开始使用 Docker 快速搭建 Hadoop 集群环境
- 使用docker快速搭建Spark集群的方法教程
- 详解使用docker搭建hadoop分布式集群
- 详解docker搭建redis集群的环境搭建
- docker搭建rabbitmq集群环境的方法
- 详解使用docker 1.12 搭建多主机docker swarm集群
- 在Ubuntu 16.04上用Docker Swarm和DigitalOcean创建一个Docker容器集群的方法
- Docker使用Swarm组建集群的方法
- docker 搭建hadoop以及hbase集群详解
- ubuntu docker搭建Hadoop集群环境的方法
- Docker集群的创建与管理实例详解
- 云计算之路-阿里云上:docker swarm 集群故障与异常
- 云计算之路-阿里云上:节点 CPU 波动引发 docker swarm 集群故障
- 故障公告:docker swarm集群“群龙无首”造成部分站点无法访问
- 云计算之路-阿里云上-容器难容:容器服务故障以及自建 docker swarm 集群故障
- 故障公告:docker swarm集群“群龙无首”造成部分站点无法访问
- 云计算之路-阿里云上:部分服务器未及时续费造成docker swarm集群故障
- 【故障公告】10:30-10:45 左右 docker swarm 集群节点问题引发故障
- 详解使用docker 1.12 搭建多主机docker swarm集群
- 使用 Docker Toolbox 自动创建 Swarm 集群+Portainer 图形化管理的脚本
- docker swarm 集群及可视化界面的安装及配置 推荐
- 如何创建 Swarm 集群?- 每天5分钟玩转 Docker 容器技术(95)
- 如何创建 Swarm 集群?- 每天5分钟玩转 Docker 容器技术(95)
- Docker集群管理(三)—— docker swarm mode基础教程
- Swarm创建docker集群:服务发现-etcd
- Docker集群实验环境布署--swarm【2 搭建本地镜像仓库】
- 基于kubernetes构建Docker集群管理详解
- 用 Docker Machine 一次创建上百台Docker Swarm集群主机的方法
- 运维之我的docker-集群的管理-swarm
- Swarm创建docker集群:服务发现-etcd
- 如何创建 Swarm 集群?- 每天5分钟玩转 Docker 容器技术(95)