随着大数据时代的快速到来,以及大数据在生产生活中迅速应用,大数据领域如雨后春笋般的出现大量的新技术,如Hadoop、Spark、Storm、Impala等技术,其中Spark已经成为大数据技术中最为重要的一部分,被越来越多的企业所使用。Spark的功能涵盖了大数据领域的离线批处理、SQL类处理、流式/实时计算、机器学习、图计算等各种不同类型的计算操作,应用范围广泛、前景非常广阔。采用Spark的目的,主要是为了使大数据处理任务速度更快,效率更高。Spark在使用过程中不可避免的需要进行一系列的性能优化,本培训尹老师总结和归纳多年工作经验,就Spark、Hive、Shark、Imapla等大数据技术的性能调优进行深入剖析,使学员从实操层面提升到大数据技术核心原理层面进行调优,并通过生动的案例展示优化过程与效果,调优的范围包括规划调优、部署调优、硬件调优、网络调优、参数调优、开发调优、算法调优、运行调优、作业调优、数据调优和资源调优等。
课程收益
1、使学员掌握大数据性能调优思路
2、使学员掌握分布式的技术原理以及应用场景;
3、使学员掌握云计算、虚拟化、大数据等新兴技术以及三者之间的关系;
4、使学员具体掌握Spark技术的调优思路、方法、参数设置、开发注意事项;
5、使学员具体掌握数据仓库工具Hive的调优思路、方法、参数设置;
6、使学员具体掌握大数据即时数据分析工具Impala的设计思路、运行原理、调优方法、参数设置



京ICP备2022035414号-1