Skip to main content

KVCacheConfig

Cache-wide construction parameters; per-row geometry rides KVLayerSpec.

device (property)

(self) -> clika_runtime._core.Device

head_dim (property)

(self) -> int

k_quant (property)

(self) -> clika_runtime._core.nn.KVQuantSpec | None

k_scale (property)

(self) -> float | None

kv_cache_scheme (property)

(self) -> str

kv_dtype (property)

(self) -> clika_runtime._core.DataType

max_seqs (property)

(self) -> int

max_tokens_per_seq (property)

(self) -> int

mode (property)

(self) -> clika_runtime._core.nn.KVCacheMode

num_kv_heads (property)

(self) -> int

num_layers (property)

(self) -> int

paged (property)

(self) -> clika_runtime._core.nn.PagedParams | None

v_quant (property)

(self) -> clika_runtime._core.nn.KVQuantSpec | None

v_scale (property)

(self) -> float | None

__init__

__init____init__(self, *, num_layers: int = 0, num_kv_heads: int = 0, head_dim: int = 0, kv_dtype: clika_runtime._core.DataType = DataType.BFloat16, max_seqs: int = 1, max_tokens_per_seq: int = 0, device: clika_runtime._core.Device = Device(CPU:-1), k_quant: clika_runtime._core.nn.KVQuantSpec | None = None, v_quant: clika_runtime._core.nn.KVQuantSpec | None = None, kv_cache_scheme: str = '', k_scale: float | None = None, v_scale: float | None = None, mode: clika_runtime._core.nn.KVCacheMode = KVCacheMode.Continuous, paged: clika_runtime._core.nn.PagedParams | None = None) -> None

init(self, *, num_layers: int = 0, num_kv_heads: int = 0, head_dim: int = 0, kv_dtype: clika_runtime._core.DataType = DataType.BFloat16, max_seqs: int = 1, max_tokens_per_seq: int = 0, device: clika_runtime._core.Device = Device(CPU:-1), k_quant: clika_runtime._core.nn.KVQuantSpec | None = None, v_quant: clika_runtime._core.nn.KVQuantSpec | None = None, kv_cache_scheme: str = '', k_scale: float | None = None, v_scale: float | None = None, mode: clika_runtime._core.nn.KVCacheMode = KVCacheMode.Continuous, paged: clika_runtime._core.nn.PagedParams | None = None) -> None