Skip to content

7. Verifying the Installation

7.1 Check node resources and labels

kubectl get nodes -o custom-columns=NAME:.metadata.name,GPU:.status.allocatable.'nvidia\.com/gpu'
kubectl get node <node> --show-labels | tr ',' '\n' | grep nvidia.com

Important GFD labels:

nvidia.com/gpu.present=true
nvidia.com/gpu.product=NVIDIA-H100-80GB-HBM3
nvidia.com/gpu.memory=81559
nvidia.com/gpu.count=8
nvidia.com/gpu.family=hopper
nvidia.com/gpu.compute.major=9
nvidia.com/cuda.driver.major=12
nvidia.com/mig.capable=true
nvidia.com/gpu.replicas=1
nvidia.com/gpu.sharing-strategy=none
nvidia.com/gpu.deploy.driver=true

7.2 Run a CUDA test pod

apiVersion: v1
kind: Pod
metadata:
  name: cuda-vectoradd
spec:
  restartPolicy: OnFailure
  containers:
    - name: cuda-vectoradd
      image: nvcr.io/nvidia/k8s/cuda-sample:vectoradd-cuda12.5.0
      resources:
        limits:
          nvidia.com/gpu: 1
kubectl apply -f cuda-vectoradd.yaml
kubectl logs cuda-vectoradd
# [Vector addition of 50000 elements] ... Test PASSED

7.3 Run nvidia-smi from inside the driver container

kubectl exec -n gpu-operator -it ds/nvidia-driver-daemonset -- nvidia-smi
kubectl exec -n gpu-operator -it ds/nvidia-driver-daemonset -- nvidia-smi topo -m

7.4 Check ClusterPolicy status

kubectl get clusterpolicies.nvidia.com cluster-policy -o jsonpath='{.status.state}'
# ready