Art Wittmann | Oracle 技术内容总监 | 2025 年 2 月 9 日
每家企业都需要数据中心策略。该策略的灵活性、可扩展性和覆盖范围取决于具体组织,但技术对企业越重要,就越需要一个可靠的计划来支持业务目标。
数据中心是高效的集成式技术运营的基础,但已不再是唯一的焦点。相反,数据中心及其内部系统需要融入更大的图景当中,而这通常涉及必须与自有数据中心内的资源实现互联的云端资源。
数据中心策略是一份计划,它详细说明组织的技术在何处运行以及利益相关方如何访问这些技术。数据中心策略必须同时审视与组织持续改进相关的技术和业务问题,包括以下要素:
关键要点
作为物理结构,数据中心存在局限性。超出现有数据中心在占地空间、电力和散热方面的承载能力进行扩展,成本会非常高昂。同样,制定退出组织自有数据中心的计划也可能意味着多年的投入,因为数据中心内运行的工作负载需要迁移、更新或转换为云端应用。
策略必须在扩展现有设施与退出现有设施之间规划出一条路径,涵盖云技术和托管设施可能发挥的作用。
其他战略考量,如连续性计划和一般业务演变,也将为数据中心策略提供参考。例如,在单一数据中心内运行所有系统会形成单点故障,这往往是不可承受的风险。对于许多组织而言,目标是不再扩展数据中心空间。相反,目标应该是将现有空间与其他资源(包括云技术)结合使用,来满足组织的需求。
为组织制定合适的数据中心策略,前提是决定工作负载的理想运行位置,以及技术策略的理想实现方式。请考虑以下要素:
制定数据中心策略涉及评估当前需求和设施、识别业务需求与增长预期,并确定最佳的技术和基础设施以支持组织发展。请注意,如果您拥有数据中心,就已经有了一套数据中心策略,它可能贴合当前业务优先事项并与之同步,也可能已显过时、亟待关注。但了解现状是制定一份供 IT 管理层及其他利益相关方审阅的文件的关键第一步。
1. 明确您当前的数据中心策略
这一步主要涉及收集预算、程序和现有计划,并将它们汇总到一份文档中,该文档既介绍了高层次的策略,也包含常用来执行该策略的步骤。如果这是第一次进行这种梳理,数据中心策略很可能被归结为“在现有预算范围内支持现有工作负载”。对项目而言,重要的是记录当前向业务伙伴提供的 SLA,以及近期的故障记录。目标很简单,即要回答这样一个问题:我们目前在做什么,效果如何?
2. 使 IT 策略与业务目标保持一致
IT 的客户对其所获得的服务的满意程度如何?业务合作伙伴不太可能对您的数据中心本身有特殊的看法,但会对其支持的工作负载的价值和性能有强烈的意见。就应用程序响应速度、软件最新版本的可用性、应用程序之间集成的质量以及应用程序产出数据的效用,向合作伙伴征询反馈。
如果某个应用程序在本地运行,意味着升级要么进展缓慢,要么根本无法实现,那么可能是时候考虑转向即服务模式了。同样,如果在数据中心中运行应用程序会提高其拥有成本,或者降低其性能(比如对远程用户而言),那么是时候进行重新评估了。
3. 评估不断变化的 IT 环境
审视您的典型设备升级周期。您是否能够满足本地部署应用程序对存储和计算能力的增长需求?您是否清楚应用程序关键性的变化、可能增加的使用量、新增或更新的法规、新的工作负载以及路线图上的其他事项?所有这些都可能意味着数据中心需要承载新的工作负载,或者需要将某些工作负载迁移至云端。
4. 记录当前 IT 资产
很难想象一家达到企业级规模的 IT 组织会没有资产清单,毕竟财务部门需要详细的 IT 资产列表,以便对设备进行合理的折旧核算。负责资产管理的团队也会跟踪公司拥有的资产以及资产的位置。企业通常会跟踪软件订阅与许可证、位置、合同、支持、网络拓扑图等。
不过,库存控制清单通常不具备 IT 所需的详细程度。这些团队需要资产清单,其中需包含当前固件版本以及可能已安装的附加组件(如网卡或其他总线卡)。这些信息通常可以在编排系统中找到,该系统很可能需要在每台服务器上运行 agent。这些 agent 将评估运行状况并报告所有配置更改。同样,编排系统也会感知网络硬件和存储系统的状态。
如果您出于某种原因没有使用任何形式的编排软件,您可能需要使用配置管理数据库。这些数据库在虚拟化普及之前曾很流行,同样能为您提供数据中心内运行的系统的必要信息。
5. 评估当前数据中心选项
您如何选择将取决于您的目标以及其他因素,包括现有租约、电力使用量、设施状况、可用容量,以及相对于业务和用户需求的位置。数据中心可以履行其职责,但需要更多容量?要解决这个问题,可能需要增强电力供应和散热能力,或者可能仅仅是以不同的方式利用现有散热资源。
如果您希望关闭数据中心,那么这会是一项大得多的任务。对于大多数企业来说,退出一个数据中心需要数年时间,而且成本高昂。重点不在于数据中心有哪些选项,而在于重新思考如何管理工作负载,以更好地满足业务需求。
如果情况特殊,比如您的数据中心即将面临拆除,那么就需要从确定将每个工作负载迁移到何处入手。可选方案包括托管设施、将工作负载迁移至公有云或私有云技术服务,以及将工作负载转移至企业拥有的其他数据中心。如果拆除迫在眉睫,评估每个选项的成本和时间将非常重要,但在大多数情况下,更明智的做法是从业务对 IT 基础设施的需求出发,然后反向推演当前的数据中心是否能胜任这一长期规划。
6. 制定应用程序计划
数据中心的去留绝不应左右应用程序计划。真正重要的是这些应用程序本身,以及它们如何赋能业务。数据中心只不过是一个运行着部分应用程序的物理场所。例如,仅仅因为数据中心的问题(比如暖通空调即将到达使用寿命),就考虑将人力资源系统迁移到云技术服务,这种做法是极其不明智的。另一方面,如果迁移到基于云技术的人力资源应用程序最符合公司利益,那么该决策就可能会影响您的数据中心策略。
迁移任何企业应用程序都是一项重要决策,可能影响企业的长远发展,因此不应受数据中心策略变更的影响。准确地说:应用程序策略应驱动数据中心策略。绝不应反其道而行之。
7. 构建自定义框架
每个组织在预算、现有资产、IT 资源、数据通信需求、应用程序以及未来可扩展性预期方面各有不同。特别是当组织拥有多个数据中心、使用托管设施并在云端运行应用程序时,梳理一份详尽的在用资源自定义清单,是明确数据中心未来定位的重要一步。应用程序全景图优先;工作负载的管理和交付方式次之。这将帮助您构建所需的框架,来管理数据中心本身可能需要发生的变更。
8. 将当前状态与自定义场景进行对比
在掌握了工作负载运行位置的全景图之后,是时候进行一些场景推演了。虽然问“如果没有这个数据中心会怎样”或“如果我们在数据中心增加一些关键工作负载会怎样”这类问题完全合理,不必立刻考虑成本,但也要认识到,这类举措往往代价高昂、耗时且耗费大量资源。大规模举措带来的收益也应当同样可观。例如,完全退出数据中心意味着迁移数百甚至数千个工作负载,可能需要数年时间才能完成。
9. 如有需要,请联系专家
坦白说,数据中心迁移并非易事。面对日新月异的技术,以及预算和资源的双重限制,做出关键决策往往会让人感到困惑,严重时甚至会让人倍感压力、力不从心。幸运的是,有广泛的顾问群体可以指导甚至管理这一旅程。在许多情况下,聘请顾问的成本,哪怕只是进行一次全面检查,都是非常值得的投资,往往远比处理意外挫折的成本低得多。
10. 选择策略并制定路线图
掌握当前状态和策略指导信息后,是时候深入了解细节并制定路线图了。这一阶段涉及具体步骤:保护和迁移数据、审视自动化选项、划分部门与数据段的优先级、评估电力需求,以及制定时间表。每个组织都需要制定一份独特的路线图,以体现其现有配置、预算、应用程序连接、时间表、安全需求、外部供应商合同、多云/混合云连接以及内部功能需求等方面的复杂性。一份周密的路线图可以确保将风险和意外降到最低,同时助力团队识别最大的迁移挑战并主动做好规划。
有效数据中心策略的关键组成部分包括:清晰理解当前的基础设施和未来需求,构建稳健的安全与合规功能,利用高效且经济实惠的硬件和设施,确保灾难恢复计划到位,选择有能力的供应商合作伙伴,以及招聘或培训一支能够有效管理和维护数据中心基础设施的 IT 团队。
以下是对有效数据策略具体组成部分的展开说明:
基础设施设计与可扩展性
了解计算、存储和网络需求可为基础设施设计提供指导,并有助于确定更新周期的安排。您的数据中心很可能已经习惯了随着每次更新周期的技术升级而带来的渐进式性能提升。但新的用途和新的应用程序可能不适合这种渐进模式。尤其是,修改系统以响应客户查询(例如关于库存可用性、新订单或交付进度的查询)可能会大幅增加对应用程序的需求。应用程序和基础设施都必须设计为能够处理新的负载。
安全与合规措施
每个数据中心要素都应达到基于最新技术和风险水平的安全标准。但是,许多组织还需要在此基础上增加额外的安全层。政府合同或持有医疗、金融或其他类型的敏感数据的情况需要专门的安全配置。此外,数据中心还必须满足区域合规需求,例如欧盟的 GDPR 和《加州消费者隐私法案》(CCPA)。
能效与散热解决方案
更换数据中心的散热或备用电源系统的成本极其高昂,因此,在设施现有散热和电力容量范围内采取相应措施,可能成为设备布局的关键因素。将产生大量热量的服务器分散到多个机架上是防范数据中心热点的第一道防线。在需要将系统集中放置的情况下,配备增强散热和高容量电源的机架,可以延长数据中心现有系统的可用性。那些需要完全不同的服务器、存储、网络、电源和散热的新工作负载或独特工作负载,可能更适合托管设施或云部署。
灾难恢复与业务连续性
任何数据中心,即便是混合架构,都需要一套稳健的灾难恢复计划,其中涵盖针对自然灾害、网络连接问题和重大停电等最坏情况的应急预案。业务连续性 (BC) 计划包含对数据中心业务支持的考量,并提供数据中心无法访问时的应急方案。
供应商选择与管理
组织的供应商选择可能会显著影响数据中心的性能、成本效益和安全性。选择和管理供应商时有一些关键考量因素;首先需要确保供应商的路线图与您的战略目标一致,并且该提供商能够长期支持您的增长,同时还要考量行业专业知识、过往业绩和财务稳定性等因素。评估供应商的技术能力和交付高质量解决方案的过往业绩。可用的 SLA 和定价模式是否符合您的特定需求?其安全实践是否满足您组织的要求?可能最重要的一点是,寻找那些致力于创新并投资 AI、自动化和高级安全功能等新兴技术的供应商。
员工培训与技能培养
随着服务器集成更强的计算能力并产生更多热量,掌握密集部署数据中心内网络、散热和配电的动态特性,将成为一项日益紧缺的独特技能。管理访问和处理不可避免的系统故障也需要专门的专业知识。越来越多拥有数据中心的企业需要提升员工技能,以满足人员配置需求。
数据中心及其驱动技术的变化速度并不算快,尽管在配电、冷却、物理安全、机架密度等方面确实存在创新。但真正促使人们重新思考数据中心资源的,往往是那些与之相关的趋势。以下是一些值得关注的趋势。
向云端解决方案的转变
将工作负载迁移到云端,可作为关闭数据中心、重新调整工作负载以更好地满足业务需求,或提升可靠性与可扩展性策略的一部分。对于某些场景,是时候放弃旧应用程序并迁移到基于 SaaS 的产品了,这些产品可与其他在用应用程序更好地集成,或者更能灵活地应对负载变化。在任何情况下,了解迁移工作负载的投资回报率都至关重要。对于较旧的应用程序,理想的选择可能是让它们在原位置继续运行。
绿色与可持续数据中心
采购可再生能源电力并实施设备回收计划,可以显著改善数据中心的可持续性。选择能够在更高温度下运行的服务器和其他系统也可以成为一种节能方式。对于本地部署系统,绿色行动通常伴随着相应成本。如果绿色环保是一个重要目标,可以考虑那些在可持续性方面投入巨大的托管设施或云技术提供商。
边缘计算与微型数据中心
边缘计算是一种为系统和应用程序提供必要处理能力的方式,而无需将实时数据流发回数据中心。仪器化的设备,例如用于制造或能源生产的设备,可能产生大量数据,将这些数据传回中央位置进行处理既不现实,也会带来过高的延迟。边缘计算系统提供强大的本地处理能力,能够在数据生成位置附近快速分析数据,仅将汇总数据发回中央数据中心。虽然边缘计算系统的优势显而易见,但这种系统也需要满足与大型数据中心相同的各种物理安全、网络安全和容错性要求。
微型数据中心是自包含系统,能够将处理能力带到更靠近最终用户或设备的位置,从而最大限度地减少延迟。它们通常是一套为满足特定需求而定制的专用硬件,安装在便携式或模块化机柜中,此类机柜可轻松部署在主数据中心环境外。
超融合基础设施 (HCI)
超融合基础设施 (HCI) 将计算、存储和网络资源虚拟化,使应用程序能够在软件中描述所需的资源,并在应用程序启动时分配这些资源。其目标是构建一个工作负载可在任意位置运行的系统,而编排工作负载运行位置,实际上只是虚拟资源的分配问题。
数据中心内的 AI 与自动化
数据中心长期以来一直受益于自动化。为服务器、存储系统和网络创建标准配置,使编排系统能够根据需求自动分配资源。没有这种程度的自动化,数据中心的运维将变得极其困难。超越自动化的下一步,是让系统能够自主发现并修复故障、优化运行,并检测各类异常,无论是即将出故障的服务器,还是试图渗透系统的攻击者。
AI 及其在数据中心内的应用是一个快速发展的领域,将推动重大创新。
Oracle Cloud Infrastructure (OCI) 是一个强大、灵活且经济高效的云技术平台。OCI 支持包括公有云、私有云、多云和分布式云技术在内的多种部署模式,并提供本地 Cloud@Customer 选项,以及主权云和专用私有云技术,是一种可扩展的选择,能够强化并完善几乎任何数据中心策略。
OCI 能够支持传统 VMware 环境以及复杂、严苛的 AI 计划等环境,为客户提供了支持其技术目标所需的灵活性。从免费试用开始。
希望补充自有数据中心的能力?尝试在这 10 个关键领域让您的数据中心更具云特性。
建设一个数据中心需要多少成本?
建设数据中心的成本差异很大,具体取决于地理位置、设施是新建还是改造,以及整体规格,如机架数量、电力和散热要求以及物理安全要求。如果资金有限,自建数据中心的一个替代方案是在托管设施中租用空间。这通常是一种经济高效的方式,既能获得高性能现代数据中心的优势,又无需自行投入时间和资金去建设。
如何优化数据中心?
优化数据中心涉及多个不同因素。IT 团队应保持定期的设备更替机制,用新设备替换过时的硬件。在实际操作层面,采用尖端硬件以及先进的散热与整合技术,可降低对设施的需求并减少硬件占地空间。各类资源的使用可以纳入自动化管理,这有助于提高利用率并满足需求。
数据中心基础设施的三个主要组成部分是什么?
数据中心基础设施的三个主要组成部分是计算硬件、数据存储和网络本身。计算硬件负责数据的处理和通信。数据存储负责管理数据文件和应用程序在网络中的存储。网络提供了在最终用户、服务器以及连接到基础设施的所有其他组件之间传输数据的手段。
托管数据中心与超大规模数据中心有何区别?
超大规模数据中心是通常位于具有成本效益的地理位置(往往是区域中心的郊区)的大型设施。超大规模数据中心通常归其支持公司所有,在许多情况下,旨在满足主要云技术提供商的需求。相对而言,托管数据中心的运作规模则小得多。托管是指组织从较大的设施租赁数据中心空间,通过分摊安全和设施等费用来降低成本。
注:为免疑义,本网页所用以下术语专指以下含义: