MySQL Authentication Failed问题分析与解决对策

2017 年 12 月 3 日 DBAplus社群 携程技术中心


作者介绍

姜宇祥,2012年加入携程,10年数据库核心代码开发经验,相关开发涉及达梦、MySQL数据库。现致力于携程MySQL的底层研发,为特殊问题定位和处理提供技术支持。

另感谢姜贤富、俞榕刚两位参与者对本文撰写提供的帮助。


问题描述


在应用端,偶尔看到有如下报错:Authentication to host 'xxxx' for user 'yyyy' using method 'mysql_native_password' failed with message: Reading from the stream has failed. 


表现特征:

  1. 只有用Connector/NET 出现这个问题, 用JDBC驱动没有类似问题。

  2. 多台应用服务器,只有一台报这个错。因此可以排除服务器端的问题。

  3. 问题非常随机。重启一下服务器/IIS,就能临时解决问题。

  4. 有一些场景应用服务器CPU并不是很高,也会偶尔抛出这个错来。


客户端是Windows机器, 驱动是MySQL Connector  ADO.NET Driver for MySQL (Connector/NET) ,使用的版本是6.9.9是比较新的版本。


问题分析


我们在应用服务器端和数据库端抓包。两边抓到的包是一致的。可以排除网络包丢失问题。下面是抓到的包,以及时间点:



从上述网络包的交互来看, 前面三个包是TCP的三次握手协议。问题出在第六个包,数据库服务器向应用服务器发送了一个Finish包,来终止数据库的连接。数据库发送Finish包,是由于数据库端发现连接超时而发送的。 这是由服务器端的Connect_timeout这个变量来控制。原因在于应用端超过10秒未向数据库服务器端发送网络包。从网络包交互的情况来看,第五个包和第六个包的时间间隔刚好是10秒。


对比正常的数据库连接和上面异常的数据库连接。 应用服务器发送第5个包到数据库端后, 应该紧接着发送下面的网络包到数据库端的。这个包主要是发送账号,驱动版本,操作系统信息等到数据库服务器端。【下面是部分的正常的网络包截图】。在出现异常报错的场景,客户端是延迟发送这个包的。在Frame 8才发送的。而此时连接已经被Finish了,在Frame 9,数据库端发送了一个Reset包到应用服务器,彻底中断连接。



我们现在具体分析,为何客户端发送账号,驱动版本,操作系统信息到数据库端这么慢。这部分的代码在Connector/NET的MySQLAuthenticationPlugin.cs文件中。 我们修改这部分代码,进行时间埋点,来进一步定位问题。下面是根据时间埋点,打印出来的跟踪信息。



从跟踪的Trace来看,有30秒左右的操作延时,全部时间集中在获取Mysqldefs:: OSDetails的属性。这部分代码如下:



这段代码是通过WMI查询,来获得Caption信息。也就是操作系统的版本信息。由于是WMI调用,所以依赖的关系比较多且与操作系统的状态相关。


问题验证


为了验证是否为WMI偶发且频繁的延时导致生产环境的某些机器出现通讯异常,我们把这段代码抽出来。下面是一段简短的重现代码:



在有问题的应用服务器上,我们运行上述代码,确实可以发现WMI查询有超时。下面这些日志信息是我们抓到的查询超过30秒的WMI信息查询操作。由此完全确认是该操作导致MySQL authentication failed错误。


2017-11-21 17:19:30.208,       33638

2017-11-21 17:20:09.193,       33199

2017-11-21 17:20:53.086,       33201

2017-11-21 17:27:05.114,       32976

2017-11-21 17:28:19.178,       33635

2017-11-21 17:30:07.130,       65977

2017-11-21 17:30:49.051,       40478

2017-11-21 17:31:15.126,       26072

2017-11-21 17:38:16.048,       66671

2017-11-21 17:38:49.204,       33152

2017-11-21 17:39:53.161,       33828

2017-11-21 17:40:38.121,       33549

2017-11-21 17:47:09.179,       33775

2017-11-21 17:47:57.174,       33164


解决思路


WMI查询慢,可能是由于多种原因所致。如操作系统CPU高,或者查询本身有死锁。这个问题有待于进一步分析。但看代码,我们知道做这个WMI查询,只是为了获得操作系统的信息。这个信息完全可以缓存起来。而不必要每次连接的时候,去进行WMI查询。


此处确定该错误的根本原因在于MySQL的C# connector中对操作系统信息的获取时间过久,导致触发服务器的连接超时。注释掉该部分可能导致长时间的操作,在问题机器上进行进一步的验证,再无任何的超时错误出现。


由于应用端的系统信息相对来说是静态信息,因此Connector/Net可以通过环境变量获取这些信息,绕过WMI调用查询。这样每次进行连接时,可避免出现查询超时的问题,并且能够提高Connector/Net的效率。



近期热文

互联网金融公司在分布式数据库的运维实践

从此爱上SQL Monitor!记一次反常理的鉴权查询优化

写了这么多年的代码,为何你仍卡在技术链最底层?

这些MySQL配置“修改条令”,你有必要熟识默记!

Gdevops火爆收官!献上干货PPT以表谢意~


近期活动

大数据与安全技术沙龙(长沙站)

登录查看更多
0

相关内容

一个开源的关系型数据库,开发者为瑞典 MySQL AB 公司。在2008年1月16号被 Sun 公司收购。而2009年,SUN 又被 Oracle 收购.目前 MySQL 被很多互联网企业所使用。有体积小、速度快、总体拥有成本低,开放源码等优点
专知会员服务
30+阅读 · 2020年5月20日
干净的数据:数据清洗入门与实践,204页pdf
专知会员服务
161+阅读 · 2020年5月14日
专知会员服务
123+阅读 · 2020年3月26日
【图神经网络(GNN)结构化数据分析】
专知会员服务
115+阅读 · 2020年3月22日
【新加坡国立大学】深度学习时代数据库:挑战与机会
专知会员服务
33+阅读 · 2020年3月6日
【干货】大数据入门指南:Hadoop、Hive、Spark、 Storm等
专知会员服务
95+阅读 · 2019年12月4日
在K8S上运行Kafka合适吗?会遇到哪些陷阱?
DBAplus社群
9+阅读 · 2019年9月4日
今日头条技术架构分析
互联网架构师
11+阅读 · 2019年8月19日
文本分析与可视化
Python程序员
9+阅读 · 2019年2月28日
占坑!利用 JenKins 持续集成 iOS 项目时遇到的问题
Neo4j 和图数据库起步
Linux中国
8+阅读 · 2017年12月20日
一个框架解决几乎所有机器学习问题
北京思腾合力科技有限公司
5+阅读 · 2017年10月13日
解决机器学习问题有通法!看这一篇就够了!
大数据文摘
4+阅读 · 2017年9月18日
【AI说】揭秘京东实时数据仓库背后的神秘力量—JDQ
Spark App自动化分析和故障诊断
CSDN大数据
7+阅读 · 2017年6月22日
Arxiv
8+阅读 · 2019年5月20日
Arxiv
6+阅读 · 2018年10月3日
Efficient and Effective $L_0$ Feature Selection
Arxiv
5+阅读 · 2018年8月7日
Bidirectional Attention for SQL Generation
Arxiv
4+阅读 · 2018年6月21日
VIP会员
相关VIP内容
专知会员服务
30+阅读 · 2020年5月20日
干净的数据:数据清洗入门与实践,204页pdf
专知会员服务
161+阅读 · 2020年5月14日
专知会员服务
123+阅读 · 2020年3月26日
【图神经网络(GNN)结构化数据分析】
专知会员服务
115+阅读 · 2020年3月22日
【新加坡国立大学】深度学习时代数据库:挑战与机会
专知会员服务
33+阅读 · 2020年3月6日
【干货】大数据入门指南:Hadoop、Hive、Spark、 Storm等
专知会员服务
95+阅读 · 2019年12月4日
相关资讯
在K8S上运行Kafka合适吗?会遇到哪些陷阱?
DBAplus社群
9+阅读 · 2019年9月4日
今日头条技术架构分析
互联网架构师
11+阅读 · 2019年8月19日
文本分析与可视化
Python程序员
9+阅读 · 2019年2月28日
占坑!利用 JenKins 持续集成 iOS 项目时遇到的问题
Neo4j 和图数据库起步
Linux中国
8+阅读 · 2017年12月20日
一个框架解决几乎所有机器学习问题
北京思腾合力科技有限公司
5+阅读 · 2017年10月13日
解决机器学习问题有通法!看这一篇就够了!
大数据文摘
4+阅读 · 2017年9月18日
【AI说】揭秘京东实时数据仓库背后的神秘力量—JDQ
Spark App自动化分析和故障诊断
CSDN大数据
7+阅读 · 2017年6月22日
Top
微信扫码咨询专知VIP会员