RMA Ledger는 GPU 클라우드를 위한 클레임 원장입니다. 고장 난 GPU, NIC, 광모듈, PSU가 벤더 RMA를 마칠 때까지 추적합니다. 벤더가 요구하는 증거, 반송 기한, 교체 전후의 시리얼, 그리고 다시 고장 나는 교체품까지.
여러 서버 브랜드로 GPU 1,000~40,000개를 운영하는 팀을 위해 만들었습니다.
소개 영상 보기 · 1:32 · 콘셉트 영상, 표시된 모든 기록은 예시입니다
벤더마다 요구하는 증거와 기한이 다르고, 부품에 이상이 없으면 비용을 청구하기도 합니다. 대부분의 팀은 이 모든 것을 수작업으로 관리하고, 이 일만 할 사람을 채용하는 회사도 있습니다.
부품이 기한 내에 도착하지 않으면 Supermicro는 RMA 번호를 무효로 합니다. 결함이 없다고 판정된 부품에는 비용을 청구할 수도 있습니다.
출처 · supermicro.com ↗NVIDIA는 모든 RMA에 bug report와 fieldiag를 요구합니다. ECC를 끈 상태에서만 발생하는 고장은 받지 않습니다.
출처 · docs.nvidia.com ↗RMA Ledger는 감지 도구가 이미 찾아낸 문제를 받아 벤더까지 전달합니다. 모니터링도, 자산 관리도 대체하지 않습니다.
명령 하나로 벤더마다 요구하는 형식의 증거 패킷을 만들어, 로그 누락으로 반려되지 않습니다.
반송 기한, 보증 만료, 벤더 후속 조치를 놓치기 전에 Slack이나 이메일로 알려 줍니다.
시리얼마다 슬롯, 선반, 택배, 벤더를 거친 경로를 기록해, 클레임 중에 노드가 사라지지 않습니다.
“노드가 아무 통보 없이 RMA로 보내져서, 어디로 갔는지 알 수 없었습니다.” · SemiAnalysis ClusterMAX
다시 고장 난 교체품과 계속 문제가 생기는 슬롯이나 로트를 찾아냅니다.
선반에 있는 예비품, 노드에 들어간 예비품, 돌아오는 중인 예비품을 한눈에 봅니다.
벤더, SKU, 펌웨어별로 처리 완료까지 걸린 일수를 보여 줍니다. 어느 벤더가 SLA를 지키는지 구매팀에 보여 주세요.
rma-ledger collect 명령은 고장 난 노드에서 벤더에 필요한 정보를 모아 서명된 번들 하나로 만듭니다. 호스팅 원장 없이도 단독으로 실행됩니다.
$ rma-ledger collect --gpu 5 --vendor supermicro · node sjc2-r14-n07 (SYS-A22GA) · gpu 5 B200 serial 1652924038817 ✓ nvidia-bug-report.log.gz 4.1 MB ✓ fieldiag.log fail · fault follows board ✓ nvidia-smi -q ECC enabled ✓ ipmi sel 3 events ! warranty parts coverage ends Jan 14 wrote rma-1652924038817-supermicro.zip manifest.json · sha256 9f2c…e41a
GPU 8개짜리 노드가 클레임을 기다리며 멈춰 있으면 하루에 550~1,450달러의 임대 수익이 사라집니다. 슬라이더를 운영 규모에 맞게 조정해 보세요.
GPU 1,000개당 연간 GPU 부품 고장 106건(Llama 3 학습 당시 발생률), 노드당 GPU 8개를 가정했습니다. 가격은 Ornn의 2026년 10월 체결가이며 H200은 추정치입니다. 기한 만료를 막아 살린 클레임과 엔지니어 시간은 포함하지 않았습니다.
수익을 내는 단위로 비용을 냅니다. 다른 부품은 추가 비용 없이 추적하세요.
GPU 64개, 사용자 2명까지
노드당 8달러 · 월 최소 250달러
연간 계약, GPU 1,000개부터
GPU 10,000개 이상
매달 벤더에 RMA를 접수하고, 더 이상 수작업으로 쫓아다니고 싶지 않은 GPU 운영사 몇 곳을 찾고 있습니다.
가장 최근의 GPU RMA를 30분 동안 함께 살펴보세요. 어디서 시간이 걸렸고 단계마다 비용이 얼마였는지 정리해 드립니다.