{
  "schemaVersion": 1,
  "operationId": "20260823213641-315eecbf11",
  "checkedAt": "2026-08-23T21:49:36Z",
  "status": "pinned-source-zero-runtime-sequence-parallel-moe-audit",
  "revisions": {
    "vllmRelease": "v0.27.1",
    "vllmReleaseCommit": "6e448d0ea9bf3d88d898b65449ca6dc2aec170ac",
    "vllmMainAtCheck": "185cada36bb25aa55f762d004d54c5ca1e3fc753",
    "glm52Fp8Revision": "ba978f7d347eaf65d22f1a86833408afdb953541",
    "vllmRecipeCommit": "ff37f2ffe37b980e595cd5c0b687d85ba7787b2a",
    "openFixPr": 50155,
    "openFixHead": "c163980139bb7d88f03753d40d1a4cce2da1bd62",
    "openFixCodeCommit": "7918bc80bac5d917089022e6da225acf8e5bf0ab"
  },
  "model": {
    "artifact": "zai-org/GLM-5.2-FP8",
    "modelType": "glm_moe_dsa",
    "decoderLayers": 78,
    "routedExperts": 256,
    "expertsPerToken": 8,
    "nativeContextTokens": 1048576
  },
  "sourceReceipts": [
    {
      "label": "vllm-release-v0271",
      "url": "https://api.github.com/repos/vllm-project/vllm/releases/tags/v0.27.1",
      "bytes": 13963,
      "sha256": "2540adf38ce0b41534d33ddbd8427653da89a5404bcf0b7868c35e91386fdc1a"
    },
    {
      "label": "vllm-v0240-deepseek-v2",
      "url": "https://raw.githubusercontent.com/vllm-project/vllm/ee0da84ab9e04ac7610e28580af62c365e898389/vllm/model_executor/models/deepseek_v2.py",
      "bytes": 68553,
      "sha256": "c580e5c53398820fed8177ede091578c8e07706089fde15094dc5265dcb30c9f"
    },
    {
      "label": "vllm-v0250-deepseek-v2",
      "url": "https://raw.githubusercontent.com/vllm-project/vllm/702f4814fe54fabff350d43cb753ae3e47c0c276/vllm/model_executor/models/deepseek_v2.py",
      "bytes": 75319,
      "sha256": "02e72b106da8b106b9fb0adf5d22cf1cf9713d7b0f4e002c02eeee6e35ffc305"
    },
    {
      "label": "vllm-v0251-deepseek-v2",
      "url": "https://raw.githubusercontent.com/vllm-project/vllm/752a3a504485790a2e8491cacbb35c137339ad34/vllm/model_executor/models/deepseek_v2.py",
      "bytes": 75319,
      "sha256": "02e72b106da8b106b9fb0adf5d22cf1cf9713d7b0f4e002c02eeee6e35ffc305"
    },
    {
      "label": "vllm-v0260-deepseek-v2",
      "url": "https://raw.githubusercontent.com/vllm-project/vllm/568afb3a13806beb53bb2e6bd518269357b237c0/vllm/model_executor/models/deepseek_v2.py",
      "bytes": 75085,
      "sha256": "f22d4458a604875fbc3fb194119519734b3f2b2460276ef2091419ed6988f1be"
    },
    {
      "label": "vllm-v0271-deepseek-v2",
      "url": "https://raw.githubusercontent.com/vllm-project/vllm/6e448d0ea9bf3d88d898b65449ca6dc2aec170ac/vllm/model_executor/models/deepseek_v2.py",
      "bytes": 75793,
      "sha256": "bcbd9cde689ffe3f5f271aff3a5e01351b05a68371192cac9d65cb5ffc6b4ba9"
    },
    {
      "label": "vllm-v0271-parallel-config",
      "url": "https://raw.githubusercontent.com/vllm-project/vllm/6e448d0ea9bf3d88d898b65449ca6dc2aec170ac/vllm/config/parallel.py",
      "bytes": 44311,
      "sha256": "5ee765f980d8e371314caa38a27c5a21ab90f3865e697707d48e608ca4d17f3d"
    },
    {
      "label": "vllm-v0271-model-utils",
      "url": "https://raw.githubusercontent.com/vllm-project/vllm/6e448d0ea9bf3d88d898b65449ca6dc2aec170ac/vllm/model_executor/models/utils.py",
      "bytes": 38434,
      "sha256": "f2919647e35f73a8d540e8e5db0fecf2000bb52a6107c39e032a8ddd830e43a1"
    },
    {
      "label": "vllm-glm52-roadmap-46654",
      "url": "https://api.github.com/repos/vllm-project/vllm/issues/46654",
      "bytes": 6593,
      "sha256": "e8d73150d7b6d08b6264c60c26ade6aa064279d709eb75b26833811782b345c9"
    },
    {
      "label": "vllm-pr-46635",
      "url": "https://api.github.com/repos/vllm-project/vllm/pulls/46635",
      "bytes": 25503,
      "sha256": "1a8aefdaf74619a12a907b89de49c9d1027f464e4c88ec71519d5c008182508f"
    },
    {
      "label": "vllm-pr-47070",
      "url": "https://api.github.com/repos/vllm-project/vllm/pulls/47070",
      "bytes": 33888,
      "sha256": "a6773b858927367b63aae2bb8496379d23445c7a8a3ba97c2647d4b4323dd1a6"
    },
    {
      "label": "vllm-pr-47902",
      "url": "https://api.github.com/repos/vllm-project/vllm/pulls/47902",
      "bytes": 24812,
      "sha256": "c005d233cfb2063cd27b9294202ed2813bf9c6e8ed829ee0a5a1b1150dd74c0f"
    },
    {
      "label": "vllm-pr-48036",
      "url": "https://api.github.com/repos/vllm-project/vllm/pulls/48036",
      "bytes": 26711,
      "sha256": "54ba76ce04cff82edfa68e134ff2950073cd01bcc68ccad03b789bc29dfa53ca"
    },
    {
      "label": "vllm-issue-48656",
      "url": "https://api.github.com/repos/vllm-project/vllm/issues/48656",
      "bytes": 6359,
      "sha256": "02402a244a0343d2686d36761c274fe6cc8947ed081228a458cae6e8dd923053"
    },
    {
      "label": "vllm-issue-48656-comments",
      "url": "https://api.github.com/repos/vllm-project/vllm/issues/48656/comments",
      "bytes": 5240,
      "sha256": "78ec9a86a3303c38915bc2e733d6b16462c3ae457251001bc64f1e4ec3280460"
    },
    {
      "label": "vllm-pr-48849",
      "url": "https://api.github.com/repos/vllm-project/vllm/pulls/48849",
      "bytes": 28961,
      "sha256": "048a6548cbd69dc5f375e534ed39e35b5eab7f0c7161a3f8a6176f2ef4111ff1"
    },
    {
      "label": "vllm-issue-50154",
      "url": "https://api.github.com/repos/vllm-project/vllm/issues/50154",
      "bytes": 6129,
      "sha256": "e6f8c243bb42d6beb81d39f0d5a13f95d1ca3214680f1f0091870477141cbeac"
    },
    {
      "label": "vllm-pr-50155",
      "url": "https://api.github.com/repos/vllm-project/vllm/pulls/50155",
      "bytes": 18150,
      "sha256": "b55de8aaeebdfa2cf839d95ca35e93ce9a06a95388cbf75ba6663c542ea0c7e3"
    },
    {
      "label": "vllm-pr-50155-files",
      "url": "https://api.github.com/repos/vllm-project/vllm/pulls/50155/files",
      "bytes": 1066,
      "sha256": "d8efeeb2a8bf3131717ba743bcdee230d2f21f3231b8805cb5ed5f4fc3a665bd"
    },
    {
      "label": "vllm-pr-50155-checks",
      "url": "https://api.github.com/repos/ZhanqiuHu/vllm/commits/c163980139bb7d88f03753d40d1a4cce2da1bd62/check-runs",
      "bytes": 7909,
      "sha256": "72f014a4c24b3c227758c4dfb6f9d8e876b222c2cf7179e9bf20627f95fe59c3"
    },
    {
      "label": "vllm-v0271-expert-parallel-doc",
      "url": "https://raw.githubusercontent.com/vllm-project/vllm/6e448d0ea9bf3d88d898b65449ca6dc2aec170ac/docs/serving/expert_parallel_deployment.md",
      "bytes": 16860,
      "sha256": "8a9766532b5d83206de35a8993a0cd4f5fd9f303122f09294739e0814e0865f7"
    },
    {
      "label": "vllm-v0271-data-parallel-doc",
      "url": "https://raw.githubusercontent.com/vllm-project/vllm/6e448d0ea9bf3d88d898b65449ca6dc2aec170ac/docs/serving/data_parallel_deployment.md",
      "bytes": 9489,
      "sha256": "bb4f301d950b3f19127be7c93dcbe2033cc75859a998586782dd1ca0ee52749c"
    },
    {
      "label": "vllm-glm52-recipe",
      "url": "https://raw.githubusercontent.com/vllm-project/recipes/ff37f2ffe37b980e595cd5c0b687d85ba7787b2a/models/zai-org/GLM-5.2.yaml",
      "bytes": 15247,
      "sha256": "517662028453e8a0b62f53a8b507d6b8ac502aaecbd5452b396c37ea2fbae4a7"
    },
    {
      "label": "glm52-fp8-config",
      "url": "https://huggingface.co/zai-org/GLM-5.2-FP8/resolve/ba978f7d347eaf65d22f1a86833408afdb953541/config.json",
      "bytes": 29464,
      "sha256": "22e49334abf8562fecf70ca3292ba3f5b33f5602fb2bf10b52dd64a66cfe65ff"
    },
    {
      "label": "glm52-fp8-card",
      "url": "https://huggingface.co/zai-org/GLM-5.2-FP8/resolve/ba978f7d347eaf65d22f1a86833408afdb953541/README.md",
      "bytes": 10909,
      "sha256": "de23c1b7cab43a99f0fedf4edf10de0d165882a2ecb2e2bad6c5796fcabf2e46"
    },
    {
      "label": "zai-glm52-release",
      "url": "https://z.ai/blog/glm-5.2",
      "bytes": 598,
      "sha256": "63e94b9e11a2db64243ff18418011577f2a98ca7851ce9dcb0e97cfe34cc245a"
    },
    {
      "label": "zhipu-research",
      "url": "https://www.zhipuai.cn/zh/research",
      "bytes": 1236461,
      "sha256": "188772a5cb6b65eb65f02024d89d153b692ef3d3cb2c98ddd233352c0dd6ac80"
    }
  ],
  "versionMatrix": [
    {
      "tag": "v0.24.0",
      "commit": "ee0da84ab9e04ac7610e28580af62c365e898389",
      "publishedAt": "2026-06-29T19:41:59Z",
      "decoderLayerCarryGuardPresent": false,
      "activationRequiresDataParallelGreaterThanOne": true,
      "auditResult": "the later decoder-layer shape guard is absent",
      "exactAuditedPathCandidate": false,
      "dp1ExposedByStableActivationProperty": false,
      "dp2PlusRequiresLowLoadCanary": false
    },
    {
      "tag": "v0.25.0",
      "commit": "702f4814fe54fabff350d43cb753ae3e47c0c276",
      "publishedAt": "2026-07-11T20:06:44Z",
      "decoderLayerCarryGuardPresent": true,
      "activationRequiresDataParallelGreaterThanOne": true,
      "auditResult": "old shape guard present; sequence-parallel MoE activation still requires DP greater than one",
      "exactAuditedPathCandidate": true,
      "dp1ExposedByStableActivationProperty": false,
      "dp2PlusRequiresLowLoadCanary": true
    },
    {
      "tag": "v0.25.1",
      "commit": "752a3a504485790a2e8491cacbb35c137339ad34",
      "publishedAt": "2026-07-14T08:51:20Z",
      "decoderLayerCarryGuardPresent": true,
      "activationRequiresDataParallelGreaterThanOne": true,
      "auditResult": "old shape guard present; sequence-parallel MoE activation still requires DP greater than one",
      "exactAuditedPathCandidate": true,
      "dp1ExposedByStableActivationProperty": false,
      "dp2PlusRequiresLowLoadCanary": true
    },
    {
      "tag": "v0.26.0",
      "commit": "568afb3a13806beb53bb2e6bd518269357b237c0",
      "publishedAt": "2026-07-27T01:06:58Z",
      "decoderLayerCarryGuardPresent": true,
      "activationRequiresDataParallelGreaterThanOne": true,
      "auditResult": "old shape guard present after the DP1 activation regression was reverted",
      "exactAuditedPathCandidate": true,
      "dp1ExposedByStableActivationProperty": false,
      "dp2PlusRequiresLowLoadCanary": true
    },
    {
      "tag": "v0.27.1",
      "commit": "6e448d0ea9bf3d88d898b65449ca6dc2aec170ac",
      "publishedAt": "2026-08-11T10:47:49Z",
      "decoderLayerCarryGuardPresent": true,
      "activationRequiresDataParallelGreaterThanOne": true,
      "auditResult": "old shape guard remains; open PR 50155 is not included",
      "exactAuditedPathCandidate": true,
      "dp1ExposedByStableActivationProperty": false,
      "dp2PlusRequiresLowLoadCanary": true
    }
  ],
  "topologyMatrix": [
    {
      "id": "tp4-dp1-ep-default-pp1",
      "tensorParallel": 4,
      "dataParallel": 1,
      "expertParallel": true,
      "pipelineParallel": 1,
      "backend": "allgather_reducescatter",
      "expectedSequenceParallelProperty": false,
      "expectedDecoderLayerPath": false,
      "decision": "not exposed to this exact DP-dependent path in audited stable tags",
      "computedSequenceParallelProperty": false,
      "computedDecoderLayerPath": false,
      "matchesPinnedExpectation": true
    },
    {
      "id": "tp4-dp2-ep-default-pp1",
      "tensorParallel": 4,
      "dataParallel": 2,
      "expertParallel": true,
      "pipelineParallel": 1,
      "backend": "allgather_reducescatter",
      "expectedSequenceParallelProperty": true,
      "expectedDecoderLayerPath": true,
      "decision": "source-eligible risk path; require low-load output canary",
      "computedSequenceParallelProperty": true,
      "computedDecoderLayerPath": true,
      "matchesPinnedExpectation": true
    },
    {
      "id": "tp8-dp2-ep-deepep-pp1",
      "tensorParallel": 8,
      "dataParallel": 2,
      "expertParallel": true,
      "pipelineParallel": 1,
      "backend": "deepep_low_latency",
      "expectedSequenceParallelProperty": true,
      "expectedDecoderLayerPath": true,
      "decision": "source-eligible risk path; backend choice does not remove the guard",
      "computedSequenceParallelProperty": true,
      "computedDecoderLayerPath": true,
      "matchesPinnedExpectation": true
    },
    {
      "id": "tp1-dp2-ep-default-pp1",
      "tensorParallel": 1,
      "dataParallel": 2,
      "expertParallel": true,
      "pipelineParallel": 1,
      "backend": "allgather_reducescatter",
      "expectedSequenceParallelProperty": false,
      "expectedDecoderLayerPath": false,
      "decision": "tensor-parallel precondition is absent",
      "computedSequenceParallelProperty": false,
      "computedDecoderLayerPath": false,
      "matchesPinnedExpectation": true
    },
    {
      "id": "tp4-dp2-noep-default-pp1",
      "tensorParallel": 4,
      "dataParallel": 2,
      "expertParallel": false,
      "pipelineParallel": 1,
      "backend": "allgather_reducescatter",
      "expectedSequenceParallelProperty": false,
      "expectedDecoderLayerPath": false,
      "decision": "expert-parallel precondition is absent",
      "computedSequenceParallelProperty": false,
      "computedDecoderLayerPath": false,
      "matchesPinnedExpectation": true
    },
    {
      "id": "tp4-dp2-ep-default-pp2",
      "tensorParallel": 4,
      "dataParallel": 2,
      "expertParallel": true,
      "pipelineParallel": 2,
      "backend": "allgather_reducescatter",
      "expectedSequenceParallelProperty": true,
      "expectedDecoderLayerPath": false,
      "decision": "global property is true but the audited decoder layer disables this path when PP exceeds one",
      "computedSequenceParallelProperty": true,
      "computedDecoderLayerPath": false,
      "matchesPinnedExpectation": true
    },
    {
      "id": "tp4-dp2-ep-naive-pp1",
      "tensorParallel": 4,
      "dataParallel": 2,
      "expertParallel": true,
      "pipelineParallel": 1,
      "backend": "naive",
      "expectedSequenceParallelProperty": false,
      "expectedDecoderLayerPath": false,
      "decision": "different communication path; not a correctness proof or drop-in workaround",
      "computedSequenceParallelProperty": false,
      "computedDecoderLayerPath": false,
      "matchesPinnedExpectation": true
    }
  ],
  "shapeEquation": {
    "paddedTokens": "ceil(fullTokens / tensorParallel) * tensorParallel",
    "scatteredTokensPerRank": "ceil(fullTokens / tensorParallel)",
    "oldGuard": "scatteredTokensPerRank != fullTokens",
    "proposedPr50155Guard": "oldGuard || fullTokens < tensorParallel"
  },
  "shapeRows": [
    {
      "tensorParallel": 2,
      "fullTokens": 1,
      "paddedTokens": 2,
      "scatteredTokensPerRank": 1,
      "oldGuardDetectsSequenceParallel": false,
      "oldGuardShapeCollision": true,
      "proposedPr50155Guard": true,
      "proposedFallbackChangesDecision": true
    },
    {
      "tensorParallel": 2,
      "fullTokens": 2,
      "paddedTokens": 2,
      "scatteredTokensPerRank": 1,
      "oldGuardDetectsSequenceParallel": true,
      "oldGuardShapeCollision": false,
      "proposedPr50155Guard": true,
      "proposedFallbackChangesDecision": false
    },
    {
      "tensorParallel": 2,
      "fullTokens": 3,
      "paddedTokens": 4,
      "scatteredTokensPerRank": 2,
      "oldGuardDetectsSequenceParallel": true,
      "oldGuardShapeCollision": false,
      "proposedPr50155Guard": true,
      "proposedFallbackChangesDecision": false
    },
    {
      "tensorParallel": 2,
      "fullTokens": 4,
      "paddedTokens": 4,
      "scatteredTokensPerRank": 2,
      "oldGuardDetectsSequenceParallel": true,
      "oldGuardShapeCollision": false,
      "proposedPr50155Guard": true,
      "proposedFallbackChangesDecision": false
    },
    {
      "tensorParallel": 2,
      "fullTokens": 5,
      "paddedTokens": 6,
      "scatteredTokensPerRank": 3,
      "oldGuardDetectsSequenceParallel": true,
      "oldGuardShapeCollision": false,
      "proposedPr50155Guard": true,
      "proposedFallbackChangesDecision": false
    },
    {
      "tensorParallel": 2,
      "fullTokens": 6,
      "paddedTokens": 6,
      "scatteredTokensPerRank": 3,
      "oldGuardDetectsSequenceParallel": true,
      "oldGuardShapeCollision": false,
      "proposedPr50155Guard": true,
      "proposedFallbackChangesDecision": false
    },
    {
      "tensorParallel": 2,
      "fullTokens": 7,
      "paddedTokens": 8,
      "scatteredTokensPerRank": 4,
      "oldGuardDetectsSequenceParallel": true,
      "oldGuardShapeCollision": false,
      "proposedPr50155Guard": true,
      "proposedFallbackChangesDecision": false
    },
    {
      "tensorParallel": 2,
      "fullTokens": 8,
      "paddedTokens": 8,
      "scatteredTokensPerRank": 4,
      "oldGuardDetectsSequenceParallel": true,
      "oldGuardShapeCollision": false,
      "proposedPr50155Guard": true,
      "proposedFallbackChangesDecision": false
    },
    {
      "tensorParallel": 2,
      "fullTokens": 9,
      "paddedTokens": 10,
      "scatteredTokensPerRank": 5,
      "oldGuardDetectsSequenceParallel": true,
      "oldGuardShapeCollision": false,
      "proposedPr50155Guard": true,
      "proposedFallbackChangesDecision": false
    },
    {
      "tensorParallel": 2,
      "fullTokens": 10,
      "paddedTokens": 10,
      "scatteredTokensPerRank": 5,
      "oldGuardDetectsSequenceParallel": true,
      "oldGuardShapeCollision": false,
      "proposedPr50155Guard": true,
      "proposedFallbackChangesDecision": false
    },
    {
      "tensorParallel": 2,
      "fullTokens": 11,
      "paddedTokens": 12,
      "scatteredTokensPerRank": 6,
      "oldGuardDetectsSequenceParallel": true,
      "oldGuardShapeCollision": false,
      "proposedPr50155Guard": true,
      "proposedFallbackChangesDecision": false
    },
    {
      "tensorParallel": 2,
      "fullTokens": 12,
      "paddedTokens": 12,
      "scatteredTokensPerRank": 6,
      "oldGuardDetectsSequenceParallel": true,
      "oldGuardShapeCollision": false,
      "proposedPr50155Guard": true,
      "proposedFallbackChangesDecision": false
    },
    {
      "tensorParallel": 2,
      "fullTokens": 13,
      "paddedTokens": 14,
      "scatteredTokensPerRank": 7,
      "oldGuardDetectsSequenceParallel": true,
      "oldGuardShapeCollision": false,
      "proposedPr50155Guard": true,
      "proposedFallbackChangesDecision": false
    },
    {
      "tensorParallel": 2,
      "fullTokens": 14,
      "paddedTokens": 14,
      "scatteredTokensPerRank": 7,
      "oldGuardDetectsSequenceParallel": true,
      "oldGuardShapeCollision": false,
      "proposedPr50155Guard": true,
      "proposedFallbackChangesDecision": false
    },
    {
      "tensorParallel": 2,
      "fullTokens": 15,
      "paddedTokens": 16,
      "scatteredTokensPerRank": 8,
      "oldGuardDetectsSequenceParallel": true,
      "oldGuardShapeCollision": false,
      "proposedPr50155Guard": true,
      "proposedFallbackChangesDecision": false
    },
    {
      "tensorParallel": 2,
      "fullTokens": 16,
      "paddedTokens": 16,
      "scatteredTokensPerRank": 8,
      "oldGuardDetectsSequenceParallel": true,
      "oldGuardShapeCollision": false,
      "proposedPr50155Guard": true,
      "proposedFallbackChangesDecision": false
    },
    {
      "tensorParallel": 4,
      "fullTokens": 1,
      "paddedTokens": 4,
      "scatteredTokensPerRank": 1,
      "oldGuardDetectsSequenceParallel": false,
      "oldGuardShapeCollision": true,
      "proposedPr50155Guard": true,
      "proposedFallbackChangesDecision": true
    },
    {
      "tensorParallel": 4,
      "fullTokens": 2,
      "paddedTokens": 4,
      "scatteredTokensPerRank": 1,
      "oldGuardDetectsSequenceParallel": true,
      "oldGuardShapeCollision": false,
      "proposedPr50155Guard": true,
      "proposedFallbackChangesDecision": false
    },
    {
      "tensorParallel": 4,
      "fullTokens": 3,
      "paddedTokens": 4,
      "scatteredTokensPerRank": 1,
      "oldGuardDetectsSequenceParallel": true,
      "oldGuardShapeCollision": false,
      "proposedPr50155Guard": true,
      "proposedFallbackChangesDecision": false
    },
    {
      "tensorParallel": 4,
      "fullTokens": 4,
      "paddedTokens": 4,
      "scatteredTokensPerRank": 1,
      "oldGuardDetectsSequenceParallel": true,
      "oldGuardShapeCollision": false,
      "proposedPr50155Guard": true,
      "proposedFallbackChangesDecision": false
    },
    {
      "tensorParallel": 4,
      "fullTokens": 5,
      "paddedTokens": 8,
      "scatteredTokensPerRank": 2,
      "oldGuardDetectsSequenceParallel": true,
      "oldGuardShapeCollision": false,
      "proposedPr50155Guard": true,
      "proposedFallbackChangesDecision": false
    },
    {
      "tensorParallel": 4,
      "fullTokens": 6,
      "paddedTokens": 8,
      "scatteredTokensPerRank": 2,
      "oldGuardDetectsSequenceParallel": true,
      "oldGuardShapeCollision": false,
      "proposedPr50155Guard": true,
      "proposedFallbackChangesDecision": false
    },
    {
      "tensorParallel": 4,
      "fullTokens": 7,
      "paddedTokens": 8,
      "scatteredTokensPerRank": 2,
      "oldGuardDetectsSequenceParallel": true,
      "oldGuardShapeCollision": false,
      "proposedPr50155Guard": true,
      "proposedFallbackChangesDecision": false
    },
    {
      "tensorParallel": 4,
      "fullTokens": 8,
      "paddedTokens": 8,
      "scatteredTokensPerRank": 2,
      "oldGuardDetectsSequenceParallel": true,
      "oldGuardShapeCollision": false,
      "proposedPr50155Guard": true,
      "proposedFallbackChangesDecision": false
    },
    {
      "tensorParallel": 4,
      "fullTokens": 9,
      "paddedTokens": 12,
      "scatteredTokensPerRank": 3,
      "oldGuardDetectsSequenceParallel": true,
      "oldGuardShapeCollision": false,
      "proposedPr50155Guard": true,
      "proposedFallbackChangesDecision": false
    },
    {
      "tensorParallel": 4,
      "fullTokens": 10,
      "paddedTokens": 12,
      "scatteredTokensPerRank": 3,
      "oldGuardDetectsSequenceParallel": true,
      "oldGuardShapeCollision": false,
      "proposedPr50155Guard": true,
      "proposedFallbackChangesDecision": false
    },
    {
      "tensorParallel": 4,
      "fullTokens": 11,
      "paddedTokens": 12,
      "scatteredTokensPerRank": 3,
      "oldGuardDetectsSequenceParallel": true,
      "oldGuardShapeCollision": false,
      "proposedPr50155Guard": true,
      "proposedFallbackChangesDecision": false
    },
    {
      "tensorParallel": 4,
      "fullTokens": 12,
      "paddedTokens": 12,
      "scatteredTokensPerRank": 3,
      "oldGuardDetectsSequenceParallel": true,
      "oldGuardShapeCollision": false,
      "proposedPr50155Guard": true,
      "proposedFallbackChangesDecision": false
    },
    {
      "tensorParallel": 4,
      "fullTokens": 13,
      "paddedTokens": 16,
      "scatteredTokensPerRank": 4,
      "oldGuardDetectsSequenceParallel": true,
      "oldGuardShapeCollision": false,
      "proposedPr50155Guard": true,
      "proposedFallbackChangesDecision": false
    },
    {
      "tensorParallel": 4,
      "fullTokens": 14,
      "paddedTokens": 16,
      "scatteredTokensPerRank": 4,
      "oldGuardDetectsSequenceParallel": true,
      "oldGuardShapeCollision": false,
      "proposedPr50155Guard": true,
      "proposedFallbackChangesDecision": false
    },
    {
      "tensorParallel": 4,
      "fullTokens": 15,
      "paddedTokens": 16,
      "scatteredTokensPerRank": 4,
      "oldGuardDetectsSequenceParallel": true,
      "oldGuardShapeCollision": false,
      "proposedPr50155Guard": true,
      "proposedFallbackChangesDecision": false
    },
    {
      "tensorParallel": 4,
      "fullTokens": 16,
      "paddedTokens": 16,
      "scatteredTokensPerRank": 4,
      "oldGuardDetectsSequenceParallel": true,
      "oldGuardShapeCollision": false,
      "proposedPr50155Guard": true,
      "proposedFallbackChangesDecision": false
    },
    {
      "tensorParallel": 8,
      "fullTokens": 1,
      "paddedTokens": 8,
      "scatteredTokensPerRank": 1,
      "oldGuardDetectsSequenceParallel": false,
      "oldGuardShapeCollision": true,
      "proposedPr50155Guard": true,
      "proposedFallbackChangesDecision": true
    },
    {
      "tensorParallel": 8,
      "fullTokens": 2,
      "paddedTokens": 8,
      "scatteredTokensPerRank": 1,
      "oldGuardDetectsSequenceParallel": true,
      "oldGuardShapeCollision": false,
      "proposedPr50155Guard": true,
      "proposedFallbackChangesDecision": false
    },
    {
      "tensorParallel": 8,
      "fullTokens": 3,
      "paddedTokens": 8,
      "scatteredTokensPerRank": 1,
      "oldGuardDetectsSequenceParallel": true,
      "oldGuardShapeCollision": false,
      "proposedPr50155Guard": true,
      "proposedFallbackChangesDecision": false
    },
    {
      "tensorParallel": 8,
      "fullTokens": 4,
      "paddedTokens": 8,
      "scatteredTokensPerRank": 1,
      "oldGuardDetectsSequenceParallel": true,
      "oldGuardShapeCollision": false,
      "proposedPr50155Guard": true,
      "proposedFallbackChangesDecision": false
    },
    {
      "tensorParallel": 8,
      "fullTokens": 5,
      "paddedTokens": 8,
      "scatteredTokensPerRank": 1,
      "oldGuardDetectsSequenceParallel": true,
      "oldGuardShapeCollision": false,
      "proposedPr50155Guard": true,
      "proposedFallbackChangesDecision": false
    },
    {
      "tensorParallel": 8,
      "fullTokens": 6,
      "paddedTokens": 8,
      "scatteredTokensPerRank": 1,
      "oldGuardDetectsSequenceParallel": true,
      "oldGuardShapeCollision": false,
      "proposedPr50155Guard": true,
      "proposedFallbackChangesDecision": false
    },
    {
      "tensorParallel": 8,
      "fullTokens": 7,
      "paddedTokens": 8,
      "scatteredTokensPerRank": 1,
      "oldGuardDetectsSequenceParallel": true,
      "oldGuardShapeCollision": false,
      "proposedPr50155Guard": true,
      "proposedFallbackChangesDecision": false
    },
    {
      "tensorParallel": 8,
      "fullTokens": 8,
      "paddedTokens": 8,
      "scatteredTokensPerRank": 1,
      "oldGuardDetectsSequenceParallel": true,
      "oldGuardShapeCollision": false,
      "proposedPr50155Guard": true,
      "proposedFallbackChangesDecision": false
    },
    {
      "tensorParallel": 8,
      "fullTokens": 9,
      "paddedTokens": 16,
      "scatteredTokensPerRank": 2,
      "oldGuardDetectsSequenceParallel": true,
      "oldGuardShapeCollision": false,
      "proposedPr50155Guard": true,
      "proposedFallbackChangesDecision": false
    },
    {
      "tensorParallel": 8,
      "fullTokens": 10,
      "paddedTokens": 16,
      "scatteredTokensPerRank": 2,
      "oldGuardDetectsSequenceParallel": true,
      "oldGuardShapeCollision": false,
      "proposedPr50155Guard": true,
      "proposedFallbackChangesDecision": false
    },
    {
      "tensorParallel": 8,
      "fullTokens": 11,
      "paddedTokens": 16,
      "scatteredTokensPerRank": 2,
      "oldGuardDetectsSequenceParallel": true,
      "oldGuardShapeCollision": false,
      "proposedPr50155Guard": true,
      "proposedFallbackChangesDecision": false
    },
    {
      "tensorParallel": 8,
      "fullTokens": 12,
      "paddedTokens": 16,
      "scatteredTokensPerRank": 2,
      "oldGuardDetectsSequenceParallel": true,
      "oldGuardShapeCollision": false,
      "proposedPr50155Guard": true,
      "proposedFallbackChangesDecision": false
    },
    {
      "tensorParallel": 8,
      "fullTokens": 13,
      "paddedTokens": 16,
      "scatteredTokensPerRank": 2,
      "oldGuardDetectsSequenceParallel": true,
      "oldGuardShapeCollision": false,
      "proposedPr50155Guard": true,
      "proposedFallbackChangesDecision": false
    },
    {
      "tensorParallel": 8,
      "fullTokens": 14,
      "paddedTokens": 16,
      "scatteredTokensPerRank": 2,
      "oldGuardDetectsSequenceParallel": true,
      "oldGuardShapeCollision": false,
      "proposedPr50155Guard": true,
      "proposedFallbackChangesDecision": false
    },
    {
      "tensorParallel": 8,
      "fullTokens": 15,
      "paddedTokens": 16,
      "scatteredTokensPerRank": 2,
      "oldGuardDetectsSequenceParallel": true,
      "oldGuardShapeCollision": false,
      "proposedPr50155Guard": true,
      "proposedFallbackChangesDecision": false
    },
    {
      "tensorParallel": 8,
      "fullTokens": 16,
      "paddedTokens": 16,
      "scatteredTokensPerRank": 2,
      "oldGuardDetectsSequenceParallel": true,
      "oldGuardShapeCollision": false,
      "proposedPr50155Guard": true,
      "proposedFallbackChangesDecision": false
    }
  ],
  "shapeSummary": [
    {
      "tensorParallel": 2,
      "mathematicallyProvenOldGuardCollisionTokenCounts": [
        1
      ],
      "proposedFallbackChangesTokenCounts": [
        1
      ],
      "oldGuardAlreadyDetectsBelowTpTokenCounts": []
    },
    {
      "tensorParallel": 4,
      "mathematicallyProvenOldGuardCollisionTokenCounts": [
        1
      ],
      "proposedFallbackChangesTokenCounts": [
        1
      ],
      "oldGuardAlreadyDetectsBelowTpTokenCounts": [
        2,
        3
      ]
    },
    {
      "tensorParallel": 8,
      "mathematicallyProvenOldGuardCollisionTokenCounts": [
        1
      ],
      "proposedFallbackChangesTokenCounts": [
        1
      ],
      "oldGuardAlreadyDetectsBelowTpTokenCounts": [
        2,
        3,
        4,
        5,
        6,
        7
      ]
    }
  ],
  "sourceClaimCorrection": {
    "issue50154Claim": "the issue says the old guard can miss 1-3 tokens at TP4 because ceil(n/4) equals n",
    "auditBoundary": "for positive integers and TP greater than one, ceil(n/TP) equals n only when n equals one; broader low-batch observations require runtime traces",
    "conclusion": "The pinned source equation proves an old-guard shape collision at exactly one full token per DP rank for TP greater than one. The proposed PR fallback covers the broader n < TP range, but the issue report does not prove every value in that range fails."
  },
  "openFixAudit": {
    "issue": 50154,
    "issueStateAtCheck": "open",
    "issueCreatedAt": "2026-07-28T15:01:38Z",
    "reportedModel": "zai-org/GLM-5.2-FP8",
    "reportedTopology": "TP4 DP2 EP on two B200 nodes with enforce-eager",
    "reportedVersions": [
      "vllm-0.26.1rc1.dev18+gd223c900d",
      "vllm-0.23.1rc1.dev1403+g4080263bb"
    ],
    "reportedObservation": "garbled completion output on short prompts; CUDA graph mode did not reproduce in the reporter's later environment for an unknown reason",
    "pullRequest": 50155,
    "pullRequestStateAtCheck": "open",
    "pullRequestUpdatedAt": "2026-07-30T15:04:31Z",
    "changedFiles": 1,
    "additions": 4,
    "deletions": 1,
    "testFilesAdded": 0,
    "patchAddsLowTokenFallback": true,
    "patchAddsResidualShapeComparisonDescribedInIssue": false,
    "forkHeadPreRunCheck": "failure",
    "claimBoundary": "the issue and PR contain reporter evidence and AI-assisted prose; neither is a merged release fix or an in-house GLM52.ai runtime result"
  },
  "historicalNightlyRegression": {
    "activationRemovalPr": 48036,
    "activationRemovalMergedAt": "2026-07-14T14:00:24Z",
    "activationRestorePr": 48849,
    "activationRestoreMergedAt": "2026-07-17T14:27:50Z",
    "stableReleaseTagsPublishedInsideWindow": [],
    "reportedGlm52Nvfp4": {
      "topology": "TP4 EP DP1 on 4xH200",
      "kvCacheTokensOff": 1032448,
      "kvCacheTokensOn": 784300,
      "tokensPerSecond": {
        "n1": {
          "off": 75,
          "on": 61
        },
        "n8": {
          "off": 407,
          "on": 353
        },
        "n32": {
          "off": 931,
          "on": 875
        }
      },
      "claimBoundary": "issue-author A/B on one stack, not a current stable-release benchmark"
    },
    "reportedNemotron": {
      "model": "NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4",
      "memoryGiBBefore": 79.71,
      "memoryGiBRegression": 85.33,
      "memoryGiBAfterFix": 79.71,
      "claimBoundary": "PR-author measurement used to confirm the reverted DP1 activation path, not a GLM-5.2 measurement"
    },
    "computedReportedDeltas": {
      "glm52Nvfp4": {
        "topology": "TP4 EP DP1 on 4xH200",
        "kvCachePercent": -24.034915,
        "tokensPerSecondPercent": {
          "n1": -18.666667,
          "n8": -13.267813,
          "n32": -6.015038
        },
        "claimBoundary": "issue-author A/B on one stack, not a current stable-release benchmark"
      },
      "nemotron": {
        "memoryGiBDelta": 5.62,
        "memoryPercent": 7.050558,
        "restoredToBaseline": true,
        "claimBoundary": "PR-author measurement used to confirm the reverted DP1 activation path, not a GLM-5.2 measurement"
      }
    },
    "classification": "brief main/nightly activation regression, not an audited stable-release interval"
  },
  "runtimeBoundary": {
    "modelCalls": 0,
    "localGpuRuns": 0,
    "upstreamTestsExecutedLocally": 0,
    "sourceMathIsRuntimeReproduction": false,
    "reporterMeasurementsArePublisherBenchmarks": false
  },
  "serp": {
    "requestId": "serpapi-15b22a23c2704881a96a8d6713d0973b",
    "query": "\"GLM-5.2\" vLLM sequence parallel MoE",
    "knownRequestCost": 1,
    "value": "failed",
    "result": "network-error",
    "decisionImpact": "The failed paid query did not change the topic decision; official vLLM issues, PRs, release tags, source files, the site registry, and free search evidence were used instead. No retry was made."
  },
  "overlapAudit": {
    "prepublicationSitemapCanonicals": 86,
    "registeredScopedPages": 79,
    "exactSequenceParallelMoePages": 0,
    "nearestPage": "/guides/glm-5-2-expert-parallelism/",
    "nearestPageIntent": "size EP ranks, redundant expert slots, and EPLB rollout",
    "newPageIntent": "detect and gate GLM-5.2 vLLM sequence-parallel MoE low-load output risk across TP, DP, EP, PP, backend, and version boundaries",
    "distinctIntent": true
  },
  "aiHotCandidate": {
    "id": "cmt5wf8hm0shgro737h9vww1k",
    "permalink": "https://aihot.virxact.com/items/cmt5wf8hm0shgro737h9vww1k",
    "classification": "duplicate-intent",
    "reason": "The one-source OpenAI cyberattack warning overlaps the existing Hugging Face forensics and cybersecurity pages and supplies no new GLM-5.2 runtime artifact or deployment decision."
  },
  "rolloutDecision": {
    "classification": "fail-closed-low-load-canary-before-tp-dp-ep-promotion",
    "affectedSourceShape": "Eligible all2all backend, EP enabled, TP > 1, DP > 1, PP = 1, a GLM-5.2 MoE decoder layer, and a one-token-per-DP-rank carry state are sufficient for the proven old-guard collision.",
    "firstControl": "Use the identical checkpoint and serving options with DP1 or EP disabled as a control; changing all2all backend is a different runtime path, not proof of safety.",
    "canary": "Sweep idle and rising concurrency, force or observe one active decode token per DP rank, compare eager and graph modes, and grade deterministic completion text against the control.",
    "promoteWhen": "Pinned image and source SHA, zero output-parity failures, no repeated or malformed text, stable service metrics, and a tested one-change rollback all pass.",
    "rejectWhen": "The runtime provenance is unknown, low-load rank occupancy is unobserved, the open PR is assumed merged, only throughput is checked, or any semantic-output mismatch appears."
  },
  "invariants": {
    "twentySevenSources": true,
    "allSourceHashesAndSizesValid": true,
    "everyTopologyMatchesPinnedExpectation": true,
    "everyTpHasExactlyOneProvenShapeCollision": true,
    "proposedFallbackIsConservativeSuperset": true,
    "issueBroaderRangeNotCopiedAsMath": true,
    "auditedStableTagsKeepDp1Gate": true,
    "noStableReleaseInNightlyRegressionWindow": true,
    "fixIsOpenAndUntestedInPatch": true,
    "zeroLocalRuntime": true,
    "distinctReaderJob": true,
    "rejectedAiHotCandidateRecorded": true,
    "failedSerpDidNotTriggerRetry": true
  }
}
