
Tractian 利用 OCI 低成本、高效地构建了数百个 AI 模型
公司启用 Oracle Cloud Infrastructure 加速 AI 模型训练与推理工作负载,全面优化工业监控系统。
美国 | 高科技
“我们的 AI agent 在数十万台设备上不间断运行,将原始传感器数据转化为实时的维护决策。正是得益于 OCI 及我们的 NVIDIA GPU 基础设施,这种大规模部署才得以实现,这也赋予了我们持续探索物理 AI 模型的底气,同时丝毫不会影响客户赖以生存的业务运营。”
Tractian 总部位于亚特兰大,致力于为北美、拉丁美洲和欧洲的资产密集型行业提供物理 AI 解决方案。随着工业 AI 需求加速增长,该公司做出了初创企业中规模超大的 AI 基础设施投入之一,以推进多模态资产健康监控、大规模模型训练和实时工业智能。为了支持下一阶段的增长,Tractian 选择了 Oracle Cloud Infrastructure (OCI),使用由 NVIDIA GPU 提供支持的基础设施来大规模训练和部署 AI 模型。借助 OCI,Tractian 可以实时处理大量传感器、运营和工业数据,提供切实可行的洞察,帮助客户减少计划外停机时间、提高资产可靠性,并优化关键工业环境中的维护运营。如今,Tractian 已经实现规模化业务成果:支持超过 2,000 家工厂,监控超过 200,000 项资产;仅在过去一年中,就避免了超过 172,000 次设备故障,并防止了超过 97,000 小时的机器停机时间。
Tractian 为何选择 Oracle
Tractian 精密的 AI 模型单台设备需要处理 TB 级的传感器数据,其训练过程往往需要耗费数月之久。为了加速训练,该公司亟需具备高吞吐存储的高性能裸金属云基础设施。此外,为了满足推理需求,Tractian 还期望在规模化部署时,兼顾低延迟体验与成本的可预测性。
Tractian 最终选择了 OCI,原因在于 Oracle 能够稳定供应稀缺的 NVIDIA GPU,以及 OCI 成熟的 Kubernetes 引擎、块存储、网络以及 PostgreSQL 集成能力。同时,Tractian 也看重 Oracle 快速响应的销售与工程支持服务,及其对 OCI 平台的持续优化改进。Tractian 工程副总裁 JP Voltani 表示:“依托 OCI,我们实现了快速部署并迅速取得了业务成效。Oracle 现已成为我们模型训练领域的首选基础设施。”
成果
依托搭载 NVIDIA H100 与 GB300 GPU 的 OCI 裸金属,Tractian 成功将训练成本削减了 20%,训练耗时平均缩短了 35%,进而为客户交付了表现更卓越的 AI 模型。
在生产环境中,其推理成本降低了 15%,延迟减少了 50%,这使得 Tractian 的制造商客户能够对关键资产的维护行动进行优先级排序。
得益于这些改进,Tractian 在训练和推理方面均实现了可预测的规模化扩展。据该公司估算,基于其庞大的设备保有量,系统平均每 15 分钟即可成功预防一次客户设备故障,从而大幅提升了系统的正常运行时间和安全性。
客户快照
Tractian 自主研发硬件、软件及 AI 模型,致力于帮助制造商客户预测工业设备故障。