By Debo Dutta, Chief AI Officer, Nutanix and Yiannis Georgiou, Principal Engineer, Nutanix
오늘 Nutanix는 기업이 어디서나 에이전틱 AI를 구축하고 실행하며 관리할 수 있도록 지원한다는 비전을 더욱 가속화하기 위해 Ryax Technologies 인수를 발표했습니다. 조직들이 하이브리드, 멀티 클라우드 및 고성능 컴퓨팅 (HPC) 환경 전반으로 AI 워크로드를 확대함에 따라, 하드웨어 효율성을 극대화하고 컴퓨팅 비용을 관리하는 것이 여전히 주요 운영 과제로 자리 잡고 있습니다. Nutanix는 향후 Nutanix 쿠버네티스 플랫폼 (NKP) 및 Nutanix 엔터프라이즈 AI(NAI)에 적용될 예정인 Ryax의 고급 오케스트레이션, 스마트 스케줄링 및 텔레메트리 기반 리소스 최적화 기능을 통해 핵심 플랫폼을 한층 강화하고, GPU 활용도를 더욱 높이는 동시에 워크로드 배치를 자동화할 계획입니다. 아래에서는 현대적인 엔터프라이즈 AI 환경이 직면한 핵심 인프라 과제를 자세히 살펴보고, 이러한 계획된 기능이 리소스 밀도, 동적 사이징 및 클라우드 간 실행을 최적화하는 데 어떻게 활용될 수 있는지 알아보겠습니다.
현대적인 엔터프라이즈 AI 환경은 온프레미스와 퍼블릭 및 네오 클라우드, 쿠버네티스와 HPC 환경 전반에서 CPU와 GPU 등 다양한 하드웨어를 활용합니다. 그러나 대부분의 컴퓨팅 리소스는 여전히 심각하게 낮은 수준으로 활용되고 있습니다. 프로덕션 환경에서 AI 에이전트를 확장하려면 다음 세 가지 핵심 과제를 해결해야 합니다:
이 세 가지 문제의 근본 원인은 동일합니다. 인프라 규모 산정, 클러스터 선택 및 리소스 예약이 대부분 한 번만 수작업으로 이루어지며, 이후에는 재검토되지 않는다는 점입니다.
Ryax를 Nutanix 쿠버네티스 플랫폼(NKP) 및 Nutanix 엔터프라이즈 AI(NAI)에 통합하는 목적은 인프라의 파편화를 줄여 개발자가 개발 자체에만 집중할 수 있도록 하는 것입니다. 이를 통해 다음과 같은 기능을 제공할 수 있습니다:
Nutanix는 정적 할당을 텔레메트리 기반의 실행별 사이징으로 대체하도록 설계된 리소스 최적화 레이어를 포함하여, 향후 NKP 릴리스에 Ryax 기능을 반영할 계획입니다. 이러한 Ryax 기능은 다음과 같습니다:
실질적인 효과는 분명합니다. Ryax에서 진행한 테스트에서 30회 실행의 딥러닝 작업에 실행별 사이징을 적용한 결과, 노드 사용 시간이 62% 감소했으며 작업 완료 시간도 5.7% 단축되었습니다. 문서 지능 파이프라인에서는 서버리스 할당을 통해 실행당 GPU 점유 시간이 수 시간에서 수 분으로 단축되었으며, NVIDIA MIG 기반 분할 GPU를 사용하면 하나의 H100에서 4개의 작업을 동시에 실행할 수 있어 실행당 비용을 52% 절감할 수 있었습니다.
Ryax는 하이브리드, 멀티 클라우드 및 비쿠버네티스 인프라 전반에서 작업 배치를 최적화할 수 있도록 글로벌 메타 스케줄링 계층을 통해 NAI의 기능을 보완할 예정입니다.
Nutanix NKP와 NAI를 Ryax와 결합하면 파편화된 하이브리드 인프라를 스스로 최적화하는 AI 엔진으로 전환할 수 있습니다. 개발자와 IT 부서는 모델에 즉각적이고 통합된 방식으로 액세스하는 동시에, 백그라운드에서 GPU 활용률을 지속적으로 극대화하고 클라우드 비용을 절감하며 유휴 리소스로 인한 낭비를 줄일 수 있기를 원합니다. Nutanix와 새롭게 합류한 Ryax 팀은 이러한 요구를 비롯한 다양한 과제를 해결하기 위해 협력해 나갈 계획입니다.