即刻IT运行管理应是多面手

2019-04-21 13:58栏目:ca888圈外

高效IT运维管理应是多面手

随着云计算、大数据、移动应用等新一代信息技术的发展,企业信息化应用变得更加得心应手,但IT运维管理的压力似乎并没有减轻,反而面临更大的挑战。面对过去的老问题以及当前的新变化,如何提升运维效率,成为CIO们关注的重点。

但在解决如何提升IT运维管理效率之前,我们首先要理清一个概念——什么是IT运维管理?

IT运维管理起源于IT基础设置建设之初,是对处于运行状态下的物理网络,软硬件环境、业务系统等进行维护管理,我们把这种IT管理的工作简称为IT运维管理。

具体我们可以大致概括为以下七部分内容:

第一、设备管理:对网络设备、服务器设备、操作系统运行状况进行监控,对各种应用支持软件如数据库、中间件、群件以及各种通用或特定服务的监控管理,如邮件系统、DNS、WEB等的监控与管理;

第二、数据/存储/容灾管理:对系统和业务数据进行统一存储、备份和恢复;

第三、业务管理:包含对企业自身核心业务系统运行情况的监控与管理,对于业务的管理,主要关注该业务系统的CSF(关键成功因素Critical Success Factors)和KPI(关键绩效指标Key Performance Indicators);

第四、目录/内容管理:该部分主要对于企业需要统一发布或因人定制的内容管理和对公共信息的管理;

第五、资源资产管理:管理企业中各IT系统的资源资产情况,这些资源资产可以是物理存在的,也可以是逻辑存在的,并能够与企业的财务部门进行数据交互;

第六、信息安全管理:该部分包含了许多方面的内容,目前信息安全管理主要依据的国际标准是ISO17799,该标准涵盖了信息安全管理的十大控制方面,36个控制目标和127中控制方式,如企业安全组织方式、资产分类与控制、人员安全、物理与环境安全、通信与运营安全、访问控制、业务连续性管理等;

第七、日常工作管理:该部分主要用于规范和明确运维人员的岗位职责和工作安排、提供绩效考核量化依据、提供解决经验与知识的积累与共享手段。

IT运维是IT管理的核心和重点,也是内容最多、最繁杂的部分,每一个子系统中都包含着十分丰富的内容,也因此被很多人称之为“IT运维管理就像一个什么都能装的箩筐”。但通过梳理,你会发现,其实IT运维管理也有依有据,有规律可寻。

IT运维管理可以让业务流程变得可视化 ,就像新产品要经过严格的检验程序一样,业务流程也需要测试以证明它们能够经受住操作环境的压力和考验。一个新的或被修改过的业务流程在进行系统、技术和员工的投资之前也必须加以审核。这就需要流程可视化。

流程可视化是你能够真实地看见业务流程实施的简单而有效的方式。这种对待流程设计的方式可以植入你的企业文化之中。你可以像对待新产品一样来对待业务流程设计。

“流程”这个词不仅仅指企业的活动和工作流。“业务流程”通常包括很多业务元素。包括业务目标、需求、策略和原则,以及最佳实施策略的制定,也包括信息流,产品和服务,设备以及资金、系统和技术的支持。流程可视化的关键是把企业的基本元素和业务流程进行整合,通过演示告诉企业,你的业务流程和支持技术在真实的场景中将如何运作,信息流如何支持流程的运作,如何支持系统进行互动。

运维管理自动化可以帮助企业建立快速响应并适应企业业务环境及业务发展的IT运维模式,实现基于ITIL的流程框架、运维自动化。

运维管理自动化需求最早以代替人工操作为出发点,从初期的几台服务器发展到庞大的数据中心,单靠人工已经无法满足在技术、业务、管理等方面的要求,那么标准化、自动化、架构优化、过程优化等降低IT服务成本的因素越来越被人们所重视。发展至今,自动化作为其重要属性之一已经不仅仅只是代替人工操作,更重要的是深层探知和全局分析,关注的是在当前条件下如何实现性能与服务最优化,同时保障投资收益最大化。

传统式被动、孤立、半自动式的IT运维管理模式经常让IT部门疲惫不堪。具体表现为:运维人员被动或者效率低、缺乏一套高效的IT运维机制、缺乏高效的IT运维技术工具等等。IT运维自动化可以把IT运维人员从纷繁复杂、大量重复的工作中解放出来,专注于更有价值的工作内容。

首先,IT运维流程自动化能够提高流程的可控性,可以基于业务需求来制定个性化的流程,使企业领导有机会看见他们的业务流程,对企业流程有一个深刻的分析和理解,进而改造和优化流程。

其次,IT运维流程的自动化能提高透明度。因为随着业务需求的变化可能会有多个版本出现,手工流程的不透明将会给流程定制和优化带来相当大的困难,而自动化流程可以使用户能够一目了然的看到整个流程的各个节点运转情况,自动化工具潜移默化地提升业务保障能力。

再者,运维系统实行了自动化监控以后,通过工具自动监控对人的工作是一种减负,也是一种降低成本的表现。

简单的说,IT运维自动化是指基于流程化的框架,将事件与IT流程相关联,一旦被监控系统发生性能超标或宕机,会触发相关事件以及事先定义好的流程,可自动启动故障响应和恢复机制。

自动化工作平台还可帮助IT运维人员完成日常的重复性工作(如备份、杀毒等),提高IT运维效率。同时,IT运维的自动化还要求能够预测故障、在故障发生前能够报警,让IT运维人员把故障消除在发生前,将所产生损失减到最低。

服务流程规范化让IT运维管理有标准可参考,ITIL(IT Infrastructure Library 信息技术基础架构库)是国际上一套通用的IT服务管理标准。ITIL可以帮助IT部门建立一套最基础,但也是最规范的管理制度。参照ITIL制定一套IT运维管理制度,以此规范部门的服务标准。把每项职责都落实到人,按照“日事日清”的原则,对每位员工逐一考核。

通过IT服务规范管理,可以把支撑业务的IT系统的服务,将其纳入流程,并加以测量。IT服务管理(ITSM)就是以服务对象为中心,将IT有关工作流程化的管理起来。

服务流程规范化的最终目的是建立完善而成熟的IT运维管理体制,通过流程管理,不断提高IT运维质量,实现高效运维,提升组织内IT服务满意度,进而帮助企业建立快速响应并适应企业业务环境及业务发展的IT服务模式,使IT服务向规范化和流程化方向发展,共同促进、集团行政管理和服务水平的不断提升。

配置信息统一化,可以让企业建立统一的IT基础设施资源池,这样的做的好处是,所有的系统均处于同步运行状态,可统一管理、调配资源。

很多企业的IT运维管理平台都是按照IT服务行业标准ITIL建立,包括有事件管理、问题管理、配置管理、变更/发布管理、配置管理、作业管理、知识库、服务考核等在内的服务管理流程。

在形成闭环管理的同时,所有的流程信息均存储在配置管理库中,配置管理库所提供的数据一旦出现问题,而领导按照这个错误的数据做出了错误的决策,所造成的损失将是无法估量的。配置信息统一化后,如果某用户信息中心业务系统提前进行了告警,显示其中某台服务器负荷过高,信息中心运维人员收到告警信息之后可以立即上报,采购新的服务器。

IT运维管理平台应该着重在建设配置管理库上,配置管理数据库存储了所有配置管理的数据和信息。同时也是事件管理、问题管理、变更管理等流程查询、诊断、记录的基础,配置管理库的数据一旦出现任何问题,IT运维管理人员在对系统进行升级、改造过程中都会造成决策失误,从而影响业务系统正常运行。

IT运维管理平台的基础配置管理库具备联邦、调和、同步、映射四个重要特性。大部分厂商的配置数据库都是通过手工录入的,将繁琐的IT设备基础信息手工录入到配置管理库里,每次底层IT设备出现变更等情况都需要再录入到配置库,一旦有IT设备信息录入错误,配置资源库里的数据就会失真。

当IT设备配置项发生变动时,通过资源库检验配置项的正确性和完整性,建立统一的IT基础设施资源台帐,实现配置管理库联邦、调和、同步、映射四个重要特性。正确的数据让决策者精准的掌控业务运行全局状况,为领导决策提供科学的依据。通过资源与配置的统一管理,确保底层数据配置项准确无误,通过IT运维管理平台统一展现、全局掌控确保业务运行无忧,持续提高业务部门和客户的满意度,提高企业核心竞争力。

简言之,高效IT运维管理应该是个多面手,可看、可管、可抄、可调。

而从用户的实际应用情况来看,正是IT运维管理的上述四大作用,让用户从NSM网络安全与管理走到ITSM IT服务管理,再到BSM业务服务管理这样一个不断升级的阶段,经历了由被动管理到主动管理、由主动管理到服务导向再到业务价值实现这样一个过程。

但在云计算、大数据、移动应用这种强调“屌丝文化”的新阶段,搭建一个高质量的应用,需要IT运维人员自己动手做很多事,才能搭建一个理想的应用系统。比如:为啥云计算有很多开源的东西,却不是人人都能做?其实,云计算跟房地产一样,要占地、占机房、占带宽。另外,在海量数据汹涌来袭的大数据时代,数据增加都是被动的、延迟的,如何让IT运维管理跟得上数据发展速度,做好大数据准备,已成当务之急。同样,移动应用也对IT运维管理产生了重要影响,催热了新型IT服务,让IT运维走向APP时代。IT运维管理需要更得上移动互联发展脉搏,提升客户体验,实现不同设备与不同平台之间的对接。只有这样,高效IT运维才会完整。

随着云计算、大数据、移动应用等新一代信息技术的发展,企业信息化应用变得更加得心应手,但IT运维管理的...

图片 1

2.建设自动化

所以,我们在选择管理工具时,首要考虑的是:ITIL流程怎样贴合用户的实际情况。那么,我们就需要能够自定义服务流程这个功能。

批量修改配置及增加配置信息,提高工作效率。

在早期,一个公司的IT基础设施尚未达到一定的规模(通常在几台到几十台机器的规模),不一定有专门的运维人员或部门,运维的工作分担在各类岗位中。研发人员拥有服务器权限,自己维护和管理线上代码及业务。

在应用ITIL时,管理员会提出这样的一些问题:ITIL体系是如何建立IT服务管理流程的?具体流程是什么样的?到底是以ITIL体系为依据来建立企业的IT服务管理流程呢,还是让企业IT服务管理流程来适应ITIL体系呢?这是在ITIL体系实施与建设过程中,处理好ITIL体系与企业IT服务管理流程之间关系的一个重要问题。

自动化运维,可实现日常设备监控、主动发现问题、自动分析定位、基于标准化流程工具规范化处理、通过自动化运维操作工具处理修复等功能,最终实现监管治自动化运维。

○ 定义感兴趣的事件源,事件源是系统中的软件或者硬件模块,如:特定的命令、日志、TRAP告警等。

综合报道】ITIL作为ITSM事实上的国际标准,独立于任何厂商,基本与组织性质和业务性质无关,并且只总结IT服务管理领域最重要的...

IT运维应运而生。

● EAA嵌入式自动化架构

实际上ITIL作为跨国公司IT建设成功的基础工具,在中国企业信息化进程中也已有些不自觉的应用,如许多企业的内部IT服务台、容灾备份系统、服务级别管理SLA等也是颇具水平的。但与理性的、自觉的应用ITIL/ITSM管理思想的跨国公司相比,有意识地应用ITIL的中国企业还不多,已经应用的企业往往还不够深入、系统与全面,产生的效益也不够可观;服务台、事件管理、配置管理等应用稍多些的模块,应用往往是在“有”的水平上,尚未达到“好”的程度;变更管理、问题管理、能力管理等其它模块应用较少。为此,要想进一步提升企业IT服务的管理水平,认真学习、应用ITIL是成功的关键因素之一。

日常巡检自动化

自动化上线:充分利用TR069、Autoconfig等技术,采用零配置功能批量自动化上线设备,效率能够得到成倍提升。

如果管理工具具备“所见即所得”动态自定义表单功能,我们就可以预定义丰富的表单模板,从而建立新的工作流程,更加容易、真正实现运维管理的“随需而变”。

勤智服务流程管理系统ITSM可进行策略配置,当产生告警后,根据预先配置的策略,自动生成工单,不同的告警进行不同的工单、派单处理,有效地将服务台和服务请求、事件问题、标准变更发布流程整合,使运维服务过程有统一的任务优先级排序、跟踪和评估 / 审批,运维人员只需要根据工单进行处理即可。

图4.百度自动化技术监控框架

总之,我们在选择ITIL的管理工具时,一定要考虑自身的实际情况和真正需求,保证基于ITIL的IT运维管理系统能够不断适应自身的IT服务管理水平的持续改进与优化。

图片 2

图5.常见互联网IDC架构

那么,如何选择一个真正适合自己的管理工具呢?

图片 3

图片 4

我们知道,在ITIL的流程里,资产配置管理流程是其他流程的根基,资产配置管理功能为企业建立一套详实的配置管理数据库CMDB),系统、网络、设备、机构、合同、软件等各类信息一应俱全,为信息的查阅提供了一个全面及时的途径,做到了家底清楚心中有数。同时,维护人员可以及时掌握故障设备的所属机构、具体地址、联系电话、设备配置、用途等各类信息,作为解决故障的重要基础数据。

了解应用在全生命周期中每一个周期都需要什么样的工作、平台、组织、人员进行匹配支撑,如敏捷管理、持续性的交付、IT服务管理等。

图3.百度自动化运维技术框架

另外,诸如Portal技术、单点登录SSO技术、和底层监控系统的无缝结合,也都是我们需要考虑的。

日常操作自动化

图片 5

在使用ITIL的管理工具时,我们通常也需要一些辅助流程,这些辅助流程对于维护人员的日常工作的帮助是非常巨大的。经常使用的辅助流程应该包括:值班管理、知识库、日常作业计划、人员考核等。所以,我们应关注管理工具的辅助流程功能。

勤智运维深刻理解当前运维所面临的问题,根据多年来积累的经验,结合ITSS服务标准、DevOps、Iaas而推出的OneCenter系列产品,包含统一运维门户、多客户端移动运维、运维服务管理系统ITM、服务流程管理系统ITSM、运维自动化管理系统ITAM、运维大数据分析系统ITBA,为各行业信息化提供智能、高效、简单、自动化的IT运维管理解决方案,为企业业务提供强有力的IT支撑和质量保障。

这些企业都经历了运维发展过程中的各个阶段,运维部门曾经也是被动的、孤立的、分散的"救火队"式的团队,在后来的发展过程中,IT系统架构逐渐走向标准化、模型化,运维部门建立了完整的设备、系统资源管理数据库和知识库,包括所有硬件的配置情况、所有软件的参数配置,购买日期、维修记录,运维风险看板等等,通过网管软件,进行系统远程自动化监控。运维过程中系统会收集所有的问题、事件、变更、服务级别等信息并录入管理系统,不断完善进而形成一套趋向自动化的运作支撑机制。按照云计算的体系架构,在这样一套系统中,主要的IT资源包括计算、存储、网络资源,近些年随着网络设备厂商的推动,网络设备管理方面的自动化技术也得到十足的发展。

在应用ITIL的时候,最重要的就是选择一个管理工具,实现ITIL的落地。

数据采集自动化

图7.H3C iMC BIMS工作流程

在很多的政府信息中心,目前都面临着安全管理,如何建立安全管理体系,也是目前领导考虑的首要问题。如何将安全管理体系纳入到ITIL里,也是我们选择ITIL管理工具的一个重要方面。

图片 6

为了确保后续业务能够平滑扩容,网管系统能够顺利跟进,互联网企业一般在早期整体系统架构设计时便充分考虑到标准化、模型化,新增业务资源就好比点快餐,随需随取。

所以,灵活的配置管理和验证功能是我们所关注的第二个功能。灵活的配置管理和验证功能可以提供多种资产配置数据的录入和导入功能,并同步其他管理流程对资产配置库的改动数据,实现配置管理数据的整个生命周期的管理。同时,模板化的定义能力,具备联动底层监控系统实现资源同步和检查机制,可以发现和防止配置的随意修改。

故障发生后,运维工程师花费大量精力排查问题,无法快速和准确的定位问题,治标不治本。

批量复制:根据业务需要,梳理技术关注点,设计网络模型,进行充分测试和试点,输出软、硬件配置模板,进而可进行批量部署。

BKJIA.com 综合报道】ITIL作为ITSM事实上的国际标准,独立于任何厂商,基本与组织性质和业务性质无关,并且只总结IT服务管理领域最重要的实践部分。可以说ITIL只是IT服务管理实践的“合理抽象”,它仅明确指出应该“做什么”,但不讲“如何做”。当企业或其它组织具体实施ITIL时,就可以把标准具体化,建立自己的方法论。企业在运用内含着质量管理思想的ITIL所提供的流程和最佳实践进行内部IT服务管理时,不仅可以提供用户满意的服务从而改善客户体验,还可以确保这个过程符合成本效益的原则。

随着云计算、大数据、物联网、互联网 、IAAS的不断冲击,信息化部门也在考虑如何实现高效率的运维,将繁琐、重复工作简单化、自动化,DevOps自动化运维就显得尤为重要。

随着业务量的增长,IT基础设施发展到了另外一个量级(通常在上百台至几千台机器的规模),开始有专门的运维人员,从事日常的安装维护工作,扮演"救火队员",收告警,有运维规范,但运维主要还是为研发提供后置服务。

自动化运维场景化

二、BAT(百度、阿里、腾讯)运维系统的分析

大批量配置自动化

互联网上有两大主要元素"内容和眼球","内容"是互联网公司(或称ICP)提供的网络服务,如网页、游戏、即时通信等,"眼球"则是借指海量的互联网用户。互联网公司的内容往往分布在多个或大或小的IDC中,越来越多的"眼球"在盯着ICP所提供的内容,互联网公司进行内容存储的基础设施也呈现出了爆发式的增长。为了保障对内容的访问体验,互联网公司需要在不同的运营商、不同的省份/城市批量部署业务服务器用以对外提供服务,并为业务模块间的通信建立IDC内部网络、城域网和广域网,同时通过自建CDN或CDN专业服务公司对服务盲点进行覆盖。因此随着业务的增长,运维部门也显得愈发重要。他们经过这些年的积累,逐步形成了高效的运维体系。本文将结合国内互联网公司的经验,重点针对IT基础设施的新一代自动化运维体系展开讨论。

数据分析自动化

EAA自动化架构的执行包括如下三个步骤。

版权声明:本文由ca888发布于ca888圈外,转载请注明出处:即刻IT运行管理应是多面手