{
  "schema_version": "infercrane.cuda-kernel-screening-receipt/v1",
  "recorded_at": "2026-09-20T00:00:00+02:00",
  "evidence_class": "real-gpu-microbenchmark",
  "app_id": "ap-svOt4qZ8xDWngad41OuFXv",
  "model_shape_source": {
    "id": "Qwen/Qwen3-0.6B",
    "revision": "c1899de289a04d12100db370d81485cdf75e47ca",
    "hidden_size": 1024
  },
  "hardware": {
    "gpu_request": "H100!",
    "gpu": "NVIDIA H100 80GB HBM3",
    "compute_capability": "sm90"
  },
  "software": {
    "torch": "2.11.0+cu130",
    "cupy_cuda12x": "14.2.0",
    "vllm": "0.22.1"
  },
  "candidate": {
    "operator": "fused residual-add + RMSNorm",
    "implementation": "handwritten CUDA C++ compiled with NVRTC",
    "source": "tools/kernel-lab/fused_residual_rmsnorm_cuda.py",
    "dtype": "bfloat16",
    "threads_per_block": 256,
    "correctness": "passed against an independent float32 PyTorch oracle on every measured shape"
  },
  "measurements": [
    {
      "rows": 1,
      "cuda_ms": 0.0063238095,
      "triton_ms": 0.0057315490,
      "vllm_vendor_ms": 0.0061709504,
      "speedup_vs_triton": 0.90634,
      "speedup_vs_vllm_vendor": 0.97583
    },
    {
      "rows": 8,
      "cuda_ms": 0.0062146404,
      "triton_ms": 0.0057071985,
      "vllm_vendor_ms": 0.0059874664,
      "speedup_vs_triton": 0.91835,
      "speedup_vs_vllm_vendor": 0.96345
    },
    {
      "rows": 32,
      "cuda_ms": 0.0062647089,
      "triton_ms": 0.0056925958,
      "vllm_vendor_ms": 0.0061256776,
      "speedup_vs_triton": 0.90868,
      "speedup_vs_vllm_vendor": 0.97781
    },
    {
      "rows": 128,
      "cuda_ms": 0.0065897802,
      "triton_ms": 0.0060422572,
      "vllm_vendor_ms": 0.0064790368,
      "speedup_vs_triton": 0.91691,
      "speedup_vs_vllm_vendor": 0.98319
    },
    {
      "rows": 512,
      "cuda_ms": 0.0080932022,
      "triton_ms": 0.0071286684,
      "vllm_vendor_ms": 0.0071722340,
      "speedup_vs_triton": 0.88082,
      "speedup_vs_vllm_vendor": 0.88620
    }
  ],
  "decision": "reject handwritten CUDA candidate for serving integration",
  "reason": "correct on every shape, but 8.9-13.5 percent slower than the Triton candidate and 1.7-12.8 percent slower than the pinned vLLM vendor kernel",
  "qualification_boundary": "operator microbenchmark only; no end-to-end serving claim"
}
