mstar.engine.resources.attn.flashinfer#

Paged attention through FlashInfer’s prefill/decode wrappers.

Classes

FlashInferManager(kv_cache, device, dtype, ...)

class mstar.engine.resources.attn.flashinfer.FlashInferManager(kv_cache, device, dtype, kv_config, backend='auto')[source]#

Bases: AttentionManager

Parameters:
clear_preplan()[source]#
depends_on()[source]#
plan(step, ctx)[source]#

ret is immutable and opaque to runner; only gives to ctx.plan_results

Parameters:
qo_indptr_buf(label='main')[source]#
Parameters:

label (str)

Return type:

Tensor | None

run(q, label=None, kv_cache_layer=None, k=None, v=None, layer_idx=None)[source]#
Parameters:
Return type:

Tensor

select_last_hidden(hidden, label='main')[source]#

Select last token of the hidden vector per request, used for sampling from prefill.

Parameters:
Return type:

Tensor

property supports_preplan#