Nutanix 쿠버네티스 플랫폼과 Nutanix 엔터프라이즈 AI에 지능형 AI 워크로드 오케스트레이션 도입

By Debo Dutta, Chief AI Officer, Nutanix and Yiannis Georgiou, Principal Engineer, Nutanix

오늘 Nutanix는 기업이 어디서나 에이전틱 AI를 구축하고 실행하며 관리할 수 있도록 지원한다는 비전을 더욱 가속화하기 위해 Ryax Technologies 인수를 발표했습니다. 조직들이 하이브리드, 멀티 클라우드 및 고성능 컴퓨팅 (HPC) 환경 전반으로 AI 워크로드를 확대함에 따라, 하드웨어 효율성을 극대화하고 컴퓨팅 비용을 관리하는 것이 여전히 주요 운영 과제로 자리 잡고 있습니다. Nutanix는 향후 Nutanix 쿠버네티스 플랫폼 (NKP) 및 Nutanix 엔터프라이즈 AI(NAI)에 적용될 예정인 Ryax의 고급 오케스트레이션, 스마트 스케줄링 및 텔레메트리 기반 리소스 최적화 기능을 통해 핵심 플랫폼을 한층 강화하고, GPU 활용도를 더욱 높이는 동시에 워크로드 배치를 자동화할 계획입니다. 아래에서는 현대적인 엔터프라이즈 AI 환경이 직면한 핵심 인프라 과제를 자세히 살펴보고, 이러한 계획된 기능이 리소스 밀도, 동적 사이징 및 클라우드 간 실행을 최적화하는 데 어떻게 활용될 수 있는지 알아보겠습니다. 

고객 과제

현대적인 엔터프라이즈 AI 환경은 온프레미스와 퍼블릭 및 네오 클라우드, 쿠버네티스와 HPC 환경 전반에서 CPU와 GPU 등 다양한 하드웨어를 활용합니다. 그러나 대부분의 컴퓨팅 리소스는 여전히 심각하게 낮은 수준으로 활용되고 있습니다. 프로덕션 환경에서 AI 에이전트를 확장하려면 다음 세 가지 핵심 과제를 해결해야 합니다: 

  • 비용의 한계: 정적 리소스 할당으로 인해 고가의 가속기가 작업과 작업 사이에 유휴 상태로 남습니다.
  • 데이터 그래비티: 엔터프라이즈 데이터셋과 멀리 떨어진 곳에서 모델을 실행하면 지연 시간이 늘어나고 이그레스 비용이 증가합니다.
  • 멀티테넌트 거버넌스: 엄격한 격리 요구사항은 팀 간의 밀도 높은 리소스 빈패킹(bin-packing)과 충돌합니다.

이 세 가지 문제의 근본 원인은 동일합니다. 인프라 규모 산정, 클러스터 선택 및 리소스 예약이 대부분 한 번만 수작업으로 이루어지며, 이후에는 재검토되지 않는다는 점입니다.

핵심 가치 제안

Ryax를 Nutanix 쿠버네티스 플랫폼(NKP) 및 Nutanix 엔터프라이즈 AI(NAI)에 통합하는 목적은 인프라의 파편화를 줄여 개발자가 개발 자체에만 집중할 수 있도록 하는 것입니다. 이를 통해 다음과 같은 기능을 제공할 수 있습니다:

  • 자동 배치: 멀티 클러스터, 퍼블릭 클라우드 및 HPC 환경 전반에서 작업을 지능적으로 분산 배치합니다.
  • 동적 사이징: 과거 텔레메트리 데이터를 기반으로 리소스 할당을 지속적으로 최적화하여 정적 할당 방식을 대체합니다.
  • 통합 제어: 최소한의 복잡성으로 프로덕션 AI 스택을 배포, 운영 및 확장할 수 있는 단일 네이티브 제어 계층을 구축합니다.
infrastructure diagram

리소스 최적화 및 GPU 활용률

Nutanix는 정적 할당을 텔레메트리 기반의 실행별 사이징으로 대체하도록 설계된 리소스 최적화 레이어를 포함하여, 향후 NKP 릴리스에 Ryax 기능을 반영할 계획입니다. 이러한 Ryax 기능은 다음과 같습니다:

  • 적정 사이징 및 OOM 자동 복구: 과거 리소스 사용 프로파일을 학습하여 보다 정확한 GPU 할당량을 설정하고, 메모리 부족(OOM) 오류를 자동으로 감지해 VRAM을 확장한 후 작업을 재시도합니다. 도입 효과: 데이터 사이언티스트가 용량 계획까지 직접 담당하지 않아도, 여유 있게 리소스를 요청하는 관행을 없애고 작업 실패를 방지할 수 있습니다.
  • 세분화된 GPU 빈 패킹: GPU를 분할된 단위로 할당하여 여러 컨테이너화된 워크로드를 공유 하드웨어에 효율적으로 배치합니다. 도입 효과: 여러 엔지니어링 팀이 GPU를 최대한 활용할 수 있도록 지원하고, 섀도 IT로 인한 클라우드 리소스 임대를 줄일 수 있습니다.
  • 서버리스 GPU: 실제 컴퓨팅 작업이 실행되는 동안에만 GPU 용량을 할당하고, 작업이 완료되면 즉시 할당을 해제합니다. 도입 효과: 유휴 상태로 인한 리소스 낭비를 없애고, 밤새 대화형 노트북에 할당되어 있던 GPU를 실제 학습 작업에 활용할 수 있도록 합니다.

실질적인 효과는 분명합니다. Ryax에서 진행한 테스트에서 30회 실행의 딥러닝 작업에 실행별 사이징을 적용한 결과, 노드 사용 시간이 62% 감소했으며 작업 완료 시간도 5.7% 단축되었습니다. 문서 지능 파이프라인에서는 서버리스 할당을 통해 실행당 GPU 점유 시간이 수 시간에서 수 분으로 단축되었으며, NVIDIA MIG 기반 분할 GPU를 사용하면 하나의 H100에서 4개의 작업을 동시에 실행할 수 있어 실행당 비용을 52% 절감할 수 있었습니다.

비용, 에너지 및 클라우드 인지형 스마트 스케줄링

Ryax는 하이브리드, 멀티 클라우드 및 비쿠버네티스 인프라 전반에서 작업 배치를 최적화할 수 있도록 글로벌 메타 스케줄링 계층을 통해 NAI의 기능을 보완할 예정입니다.

  • 지능형 작업 배치: 학습, 배치 및 추론 작업을 성능, 비용 및 에너지 목표에 따라 평가하여 최적의 대상 노드 풀을 선택합니다. 도입 효과: 파이프라인 스케줄링을 개별적으로 분리된 스택에서 관리하는 대신 단일 제어 플레인으로 통합할 수 있습니다.
  • 클라우드 간 및 플랫폼 간 최적화: NVIDIA/AMD GPU 환경, 퍼블릭 클라우드 및 Slurm HPC 클러스터 전반에서 워크로드를 동적으로 분산 배치합니다.  도입 효과: 추가적인 클라우드 비용이 발생하기 전에 기존 온프레미스 베어메탈 및 HPC 투자를 최대한 활용함으로써, 고가의 하드웨어에 대한 투자 수익률을 극대화하고 클라우드 운영 비용을 최소화할 수 있습니다.
  • 에너지 기반 배치: 하드웨어 전력 모델을 사용해 클러스터를 평가하고, 예상 에너지 소비량이 가장 낮은 환경으로 워크로드를 배치합니다. 도입 효과: 에너지 관리를 자동화하고 보고 가능한 운영 지표로 전환하여 고객의 지속가능성 목표 달성을 지원할 수 있습니다.
  • 이력 기반 오토스케일링: 이전 실행의 텔레메트리 데이터를 기반으로 CPU, 메모리 및 분할 GPU 리소스를 정확하게 할당합니다. 도입 효과: 개발자가 매니페스트를 수정하거나 작업 제출 방식을 변경하지 않고도 클러스터 리소스 밀도를 높일 수 있습니다.

Nutanix NKP와 NAI를 Ryax와 결합하면 파편화된 하이브리드 인프라를 스스로 최적화하는 AI 엔진으로 전환할 수 있습니다. 개발자와 IT 부서는 모델에 즉각적이고 통합된 방식으로 액세스하는 동시에, 백그라운드에서 GPU 활용률을 지속적으로 극대화하고 클라우드 비용을 절감하며 유휴 리소스로 인한 낭비를 줄일 수 있기를 원합니다. Nutanix와 새롭게 합류한 Ryax 팀은 이러한 요구를 비롯한 다양한 과제를 해결하기 위해 협력해 나갈 계획입니다.

More Like This