format code and pass lse base for flashinfer chunked prefill

staugust · staugust · commit abf6be57eabd · 2025-11-28T11:34:24.000+08:00
Signed-off-by: augusto.yjh &lt;augusto.yjh@antgroup.com&gt;
diff --git a/vllm/attention/ops/common.py b/vllm/attention/ops/common.py
@@ -111,7 +111,11 @@ def call_kernel(self, kernel, grid, *regular_args, **const_args):
 
 
 def correct_attn_out(
-    out: torch.Tensor, lses: torch.Tensor, cp_rank: int, ctx: CPTritonContext, is_lse_base_on_e: bool=True,
+    out: torch.Tensor,
+    lses: torch.Tensor,
+    cp_rank: int,
+    ctx: CPTritonContext,
+    is_lse_base_on_e: bool = True,
 ) -> tuple[torch.Tensor, torch.Tensor]:
     """Correct the attention output using the all-gathered lses.
 
@@ -202,6 +206,7 @@ def _cp_lse_common(
 
     cp_attn_lse = cp_attn_lse.contiguous()
     lses = cp_group.all_gather(cp_attn_lse, dim=0).view_as(lses)
+<<<<<<< HEAD
     out, lse = correct_attn_out(cp_attn_out, lses, cp_group.rank_in_group, ctx, is_lse_base_on_e=is_lse_base_on_e)
     return out, lse
 
@@ -219,6 +224,13 @@ def cp_lse_ag_out_rs(
     cp_attn_lse: [ B, H ]
     """
     out, lse = _cp_lse_common(cp_attn_out, cp_attn_lse, cp_group, ctx=ctx, is_lse_base_on_e=is_lse_base_on_e)
+    out, lse = correct_attn_out(
+        cp_attn_out,
+        lses,
+        cp_group.rank_in_group,
+        ctx,
+        is_lse_base_on_e=is_lse_base_on_e,
+    )
     out = cp_group.reduce_scatter(out, dim=1)
 
     if return_lse:
diff --git a/vllm/v1/attention/backends/flashinfer.py b/vllm/v1/attention/backends/flashinfer.py
@@ -249,7 +249,11 @@ def run(
             return_lse=True,
         )
         output_context, lse_context = cp_lse_ag_out_rs(
-            output_context_tmp, lse_context_tmp, get_dcp_group(), return_lse=True, is_lse_base_on_e=False,
+            output_context_tmp,
+            lse_context_tmp,
+            get_dcp_group(),
+            return_lse=True,
+            is_lse_base_on_e=False,
         )
         lse_context = lse_context.transpose(0, 1).contiguous()
 
@@ -1335,7 +1339,10 @@ def forward(
                         return_lse=True,
                     )
                     output[:num_decode_tokens] = cp_lse_ag_out_rs(
-                        output_tmp, lse, get_dcp_group(), is_lse_base_on_e=False,
+                        output_tmp,
+                        lse,
+                        get_dcp_group(),
+                        is_lse_base_on_e=False,
                     )
                 else:
                     decode_wrapper.run(
diff --git a/vllm/v1/attention/backends/mla/common.py b/vllm/v1/attention/backends/mla/common.py
@@ -2057,7 +2057,12 @@ def forward(
 
             # correct dcp attn_out with lse.
             if self.dcp_world_size > 1:
-                attn_out = cp_lse_ag_out_rs(attn_out, lse, get_dcp_group())
+                attn_out = cp_lse_ag_out_rs(
+                    attn_out,
+                    lse,
+                    get_dcp_group(),
+                    is_lse_base_on_e: not self._use_fi_prefill,
+                )
 
             # v_up projection
             self._v_up_proj(attn_out, out=output[:num_decode_tokens])

Original file line number	Diff line number	Diff line change
`@@ -249,7 +249,11 @@ def run(`
`249`	`249`	`return_lse=True,`
`250`	`250`	`)`
`251`	`251`	`output_context, lse_context = cp_lse_ag_out_rs(`
`252`		`- output_context_tmp, lse_context_tmp, get_dcp_group(), return_lse=True, is_lse_base_on_e=False,`
	`252`	`+ output_context_tmp,`
	`253`	`+ lse_context_tmp,`
	`254`	`+ get_dcp_group(),`
	`255`	`+ return_lse=True,`
	`256`	`+ is_lse_base_on_e=False,`
`253`	`257`	`)`
`254`	`258`	`lse_context = lse_context.transpose(0, 1).contiguous()`
`255`	`259`
`@@ -1335,7 +1339,10 @@ def forward(`
`1335`	`1339`	`return_lse=True,`
`1336`	`1340`	`)`
`1337`	`1341`	`output[:num_decode_tokens] = cp_lse_ag_out_rs(`
`1338`		`- output_tmp, lse, get_dcp_group(), is_lse_base_on_e=False,`
	`1342`	`+ output_tmp,`
	`1343`	`+ lse,`
	`1344`	`+ get_dcp_group(),`
	`1345`	`+ is_lse_base_on_e=False,`
`1339`	`1346`	`)`
`1340`	`1347`	`else:`
`1341`	`1348`	`decode_wrapper.run(`