
Tractian, OCI를 사용해 수백 개의 AI 모델을 더 빠른 속도로 합리적으로 구축
산업 모니터링 시스템을 미세 조정하는 과정에서 AI 모델 학습 및 추론 워크로드를 확장하기 위해 Oracle Cloud Infrastructure를 도입한 기업
미국 | 첨단 기술
“당사의 AI 에이전트는 수십만 대의 머신 전반에서 지속적으로 실행되며, 원시 센서 데이터를 실시간 유지보수 의사 결정으로 전환합니다. OCI와 NVIDIA GPU 인프라는 이러한 규모를 실현하고, 고객이 의존하는 운영을 중단하지 않으면서 물리적 AI 모델을 계속 발전시킬 수 있도록 지원합니다.”
애틀랜타에 본사를 둔 Tractian은 북미, 라틴 아메리카, 유럽 전역의 자산 집약적 산업에 Physical AI 솔루션을 제공합니다. 산업용 AI 수요가 가속화됨에 따라 이 기업은 멀티모달 자산 상태 모니터링, 대규모 모델 학습, 실시간 산업 인텔리전스를 발전시키기 위해 스타트업으로서는 가장 큰 규모의 AI 인프라 투자를 추진하고 있습니다. 자사의 다음 성장 단계를 지원하기 위해 Tractian은 Oracle Cloud Infrastructure(OCI)를 선택했고, NVIDIA GPU 기반 인프라를 사용해 AI 모델을 대규모로 학습하고 배포하고 있습니다. Tractian은 OCI를 통해 대량의 센서, 운영, 산업 데이터를 실시간으로 처리하고, 고객이 계획되지 않은 다운타임을 줄이고, 자산 안정성을 개선하고, 중요 산업 환경 전반에서 유지보수 운영을 최적화할 수 있도록 실행 가능한 인사이트를 제공합니다. Tractian은 이미 OCI를 통해 2,000곳 이상의 공장을 지원하고, 200,000개 이상의 자산을 모니터링하고, 지난 1년 동안 172,000건 이상의 장비 고장을 방지하고, 97,000시간 이상의 기계 다운타임을 예방하는 등 큰 성과를 거두었습니다.
Tractian이 Oracle을 선택한 이유
머신당 테라바이트 단위의 센서 데이터를 필요로 하는 Tractian의 정교한 AI 모델은 훈련하는 데 수개월이 걸릴 수 있습니다. 이러한 훈련을 가속화하기 위해, 해당 기업은 고처리량 스토리지를 갖춘 고성능 베어 메탈 클라우드 인프라가 필요했습니다. Tractian은 또한 추론 요구 사항을 지원하기 위해 대규모 환경에서 낮은 지연 시간과 예측 가능한 비용을 모색하고 있었습니다.
Tractian은 Oracle의 안정적인 희소 NVIDIA GPU 액세스와 OCI의 성숙한 Kubernetes 엔진, 블록 스토리지, 네트워킹 및 PostgreSQL 통합을 이유로 OCI를 선택했습니다. 또한 신속하게 대응하는 Oracle의 영업 및 엔지니어링 지원과 OCI의 지속적인 개선을 높이 평가합니다. Tractian의 엔지니어링 부사장 JP Voltani는 말합니다. “OCI에서는 빠르게 환경을 구축하고 성공을 거둘 수 있다는 것을 확인했습니다.” “이제 Oracle은 모델 학습을 위한 우리의 최우선 선택입니다.”
성과
NVIDIA H100 및 GB300 GPU가 탑재된 OCI 베어 메탈에서 Tractian은 훈련 비용을 20% 절감하고 훈련 시간을 평균 35% 단축하여 고객에게 더욱 뛰어난 AI 모델을 제공할 수 있게 되었습니다.
프로덕션 환경에서 추론 비용은 15% 절감되고 지연 시간은 50% 단축되었습니다. 이를 통해 Tractian의 제조업 고객은 핵심 자산에 대한 유지보수 조치에서 우선순위를 정할 수 있었습니다.
이러한 개선의 결과로 Tractian은 학습과 추론 모두에서 예측 가능한 확장성을 확보했습니다. 이 회사는 자사 시스템이 설치 기반 전반에서 약 15분마다 고객 장비 장애를 예방하여 가동 시간과 안전성을 향상시킬 수 있는 것으로 추정합니다.
고객 소개
Tractian은 제조업 고객이 산업 장비의 고장을 예측할 수 있도록 하드웨어와 소프트웨어를 구축하고 자체 AI 모델을 개발합니다.