인공지능
NVIDIA와 Palantir, 공급망을 위한 주권 AI 스택 배포

Palantir Technologies (PLTR ) 와 NVIDIA는 2026년 9월 10일에 협업을 발표하여 핵심 공급망에 주권 AI를 도입했으며, AI 스택은 먼저 NVIDIA 자체 공급망 운영에 배치되었습니다. 이 배포는 NVIDIA Nemotron 오픈 모델을 Palantir Foundry와 인공지능 플랫폼(AIP)에 통합하고, Palantir Ontology에 기반을 둔 AI 스택을 생성합니다.
발표에 따르면, 이 스택은 공급망 가시성을 확보하고, 제약을 식별하며, 운영 전문 지식을 지속적으로 코드화하고, 조직이 자체 데이터에 대한 통제와 소유권을 유지하면서 기계 속도로 의사결정을 안내하는 것을 목표로 합니다. Palantir AIP 내에서 NVIDIA cuOpt 소프트웨어는 최적화 및 시나리오 계획을 지원하여 팀이 공급 제약을 모델링하고, 트레이드오프를 평가하며, 할당 결정의 운영적 영향을 이해하도록 돕습니다. 사후 학습된 Nemotron 오픈 모델은 행동을 권고하고, 트레이드오프를 설명하며, 새로운 위험을 표시하고, 공급망 전문가가 최종 결정을 통제하도록 합니다.
NVIDIA는 수백만 개의 부품, 수천 명의 공급업체 및 전 세계 제조 파트너 네트워크에 걸쳐 가장 복잡한 공급망 중 하나를 운영하고 있다고 밝혔습니다. 랙 규모 AI 시스템을 생산에 도입하려면 컴퓨팅, 메모리, 네트워킹, 전력, 냉각 및 기계 부품의 조정된 가용성이 필요하며, 회사는 각 Vera Rubin 랙에 포함된 130만 부품의 공급을 확보하기 위해 생태계와 긴밀히 협력하고 있다고 말합니다.
The NVIDIA Deployment From Wafer-Out to First Token
2026년 9월 10일자 NVIDIA 기술 블로그 게시물은 NVIDIA 솔루션 아키텍트 Nell Barber, Rana Haber, Aastha Jhunjhunwala가 작성했으며 배포 메커니즘을 자세히 설명합니다. NVIDIA는 웨이퍼 출력부터 첫 토큰까지의 공급망 성능을 측정합니다: time-to-rack은 실리콘이 팹을 떠나 데이터 센터 바닥에 조립된 시스템이 도착할 때까지의 시간을 의미하고, time-to-token은 전력, 냉각, 네트워킹 및 인프라를 생산적으로 만드는 소프트웨어 스택을 포함합니다. 단일 랙에 18개 중 하나인 Grace Blackwell NVL72 컴퓨트 트레이는 두 개의 Grace CPU, 네 개의 Blackwell GPU, 그리고 32개의 HBM3e 스택이 필요합니다. 게시물에 따르면 Vera Rubin을 위해 구축된 공급망은 Grace Blackwell의 두 배 규모입니다.
계약 제조업체는 세 가지 풀 중 하나에서 모든 부품이 도착하기 전까지 조립을 시작할 수 없습니다: NVIDIA 직접 부품, NVIDIA가 위탁 보관하는 부품, 그리고 공급업체 부품. NVIDIA는 제조 현장이 자재를 받는 순간부터 하위 조립품이나 제품의 일부로 떠날 때까지의 소유 시간(Time of Ownership) 시계를 운영합니다. 매주 각 제조 현장에 할당할 자재와 양을 결정해야 하는데, 이는 계획자가 매주 수작업으로 재작업하는 중요한 자재 할당 문제이며, 할당은 현재 분기와 다음 분기를 아우릅니다.
NVIDIA 공급망 운영팀은 Palantir와 협력하여 Palantir Foundry에 디지털 공급망 인텔리전스 커맨드 센터를 구축했으며, 여기서 Ontology는 자재, 제조 현장, 커밋, 용량, 할당, 생산 출력 및 비구조적 정성 신호를 하나의 관리된 데이터 레이어로 연결합니다. GPU 가속 의사결정 최적화를 위한 오픈소스 라이브러리인 NVIDIA cuOpt는 Ontology에서 입력을 받아 주간 할당을 소유 시간(Time of Ownership)을 최소화하는 목표를 가진 혼합 정수 선형 프로그램으로 해결합니다. 솔버는 또한 어떤 제약이 바인딩되는지 보고하며, 해결 속도가 빠르기 때문에 계획자는 특정 기간에 메모리를 10% 감소시키거나 새로운 제조 현장이 가동되는 등 답변을 중심으로 시나리오를 탐색할 수 있습니다.
역사적 할당 결정과 실제 결과를 백테스트한 결과, 인간 계획자는 솔버가 볼 수 없는 정보: 해당 주에 파트너와 주고받은 이메일, 주요 지역의 악천후 예보, 진행 중인 지정학적 사건, 공급업체 브리핑 전사본 및 수년간 축적된 전문 지식 등을 활용함으로써 솔버보다 우수한 성과를 보였습니다. 따라서 워크플로는 각 할당 결정, 그 근거, 예상 결과 및 실제 결과를 모두 포착합니다.
NVIDIA는 캡처된 결정들을 기반으로 300억 파라미터(전방 패스당 약 30억 활성 파라미터)를 가진 오픈 가중치 Nemotron 3.5 Lightning 모델을 사후 학습했습니다. 파이프라인은 NeMo Anonymizer를 사용해 개인 식별 정보를 제거하고 민감한 필드를 난독화하며, NeMo Data Designer를 통해 합성 데이터를 활용해 예시를 확장·균형화하고, NeMo AutoModel을 사용해 기본 가중치는 고정한 채 소량의 LoRA 어댑터 파라미터를 학습합니다. Palantir Autopilot은 전체 수명 주기를 관리하여 Ontology 데이터에서 각 작업을 시작하고, 배포된 모델을 모니터링하며, 데이터에서 모델 버전, 권고까지의 계보를 유지합니다.
Reported Benchmark Results
NVIDIA의 개발 벤치마크에서, 사후 학습된 Lightning 모델은 할당 결정 정확도 86.7%를 달성했으며, 이는 더 큰 Nemotron 3 Ultra의 55.5%와 기본 Lightning 모델의 17.5%와 비교됩니다(블로그 인용). 결정 유형을 예시가 아닌 동등하게 가중한 지표에서는, 사후 학습 모델이 균형 정확도 58.6%를 기록했으며 Ultra의 42.0%를, Macro-F1에서는 57.5%를 달성해 Ultra의 39.5%를 능가했습니다. LoRA 학습은 두 대의 NVIDIA B200 GPU에서 몇 분 만에 완료되었습니다. 블로그는 모델의 향상이 사후 학습된 도메인에 집중되어 있으며, 미세 조정에도 불구하고 향후 생산 위험 예측은 여전히 어려울 것이라고 밝혔습니다.
수락, 편집 및 무시된 권고는 Ontology에 다시 기록되어 충분한 대표 데이터가 축적될 때까지 누적됩니다. 양사는 이 피드백을 강화 학습에 활용할 계획이며, 수락 및 무시된 권고는 할당 정확성, 정책 준수 및 근거 기반을 포괄하는 선호 쌍을 형성합니다; 모델은 생산 환경에서 스스로 재학습하지 않습니다.
이 배포는 NVIDIA 레퍼런스 아키텍처와 공동 개발된 Palantir Sovereign AI Operating System Reference Architecture(SAIOS) 위에서 실행되며, 이는 Dell Technologies (DELL ) 와 Cisco가 지원합니다. AI 스택은 Cisco와 Dell을 포함한 시스템 제조업체와 함께 온프레미스에 배포하거나, Rackspace와 Nebius와 함께 코로케이션 및 클라우드 환경에 배포할 수 있습니다.
“NVIDIA는 세계에서 가장 가치 있고 복잡하며 정교한 공급망을 보유하고 있다고 할 수 있습니다. Nemotron 모델과 Ontology로 구동되는 우리 주권 스택은 기존 한계를 넘어서는 기능을 제공하면서, 다른 곳에서는 얻을 수 없는 알파 보호 특성을 제공합니다,” 라고 Palantir Technologies의 공동 설립자이자 CEO인 Alex Karp가 말했습니다.
“공급망은 물리적 경제의 운영 체제이며, AI 공장은 지금까지 구축된 가장 복잡한 시스템 중 하나입니다,” 라고 NVIDIA의 설립자이자 CEO인 Jensen Huang이 말했습니다.
양사는 NVIDIA 배포에서 얻은 교훈을 제조, 에너지, 의료, 자동차 및 항공우주 분야의 기업으로 확대할 계획이며, 이번 발표에서는 농업, 제조, 제약, 소매, 기술 및 정부 조직이 AI 스택을 활용해 자체 공급망 운영을 최적화할 수 있다고 언급했습니다. AI 스택과 산업 전반에 걸친 적용 사례는 Palantir의 AIPCon 11 컨퍼런스에서 선보일 예정입니다.












