Skip to main content

ClikaRT::ops::qmoe

function

2 overloads.

qmoe(QTensor, Tensor, QTensor, QTensor, …)

Tensor qmoe(
    QTensor input,
    Tensor router_logits,
    QTensor fc1_experts,
    QTensor fc2_experts,
    std::int64_t top_k,
    OptionalTensor fc1_bias = {},
    OptionalTensor fc2_bias = {},
    QTensor fc3_experts = {},
    OptionalTensor fc3_bias = {},
    OptionalTensor e_score_correction_bias = {},
    OptionalTensor router_weights = {},
    std::optional<MoeRouting> routing_mode = std::nullopt,
    std::optional<bool> renormalize = std::nullopt,
    std::optional<std::int64_t> n_group = std::nullopt,
    std::optional<std::int64_t> topk_group = std::nullopt,
    std::optional<double> routed_scaling_factor = std::nullopt,
    std::optional<double> sparse_mixer_eps = std::nullopt,
    std::optional<bool> apply_router_weight_on_input = std::nullopt,
    std::optional<Activation> activation = std::nullopt,
    std::optional<SwigluFusion> swiglu_fusion = std::nullopt,
    std::optional<double> swiglu_alpha = std::nullopt,
    std::optional<double> swiglu_beta = std::nullopt,
    std::optional<double> swiglu_limit = std::nullopt,
    std::optional<GeluMode> gelu_mode = std::nullopt,
    OptionalTensor shared_output = {}
)

Declared in ClikaRT/compute/q_tensor.h, line 1225

qmoe(QTensor, Tensor, QTensor, QTensor, …)

QTensor qmoe(
    QTensor input,
    Tensor router_logits,
    QTensor fc1_experts,
    QTensor fc2_experts,
    std::int64_t top_k,
    OptionalTensor fc1_bias,
    OptionalTensor fc2_bias,
    QTensor fc3_experts,
    OptionalTensor fc3_bias,
    OptionalTensor e_score_correction_bias,
    OptionalTensor router_weights,
    std::optional<MoeRouting> routing_mode,
    std::optional<bool> renormalize,
    std::optional<std::int64_t> n_group,
    std::optional<std::int64_t> topk_group,
    std::optional<double> routed_scaling_factor,
    std::optional<double> sparse_mixer_eps,
    std::optional<bool> apply_router_weight_on_input,
    std::optional<Activation> activation,
    std::optional<SwigluFusion> swiglu_fusion,
    std::optional<double> swiglu_alpha,
    std::optional<double> swiglu_beta,
    std::optional<double> swiglu_limit,
    std::optional<GeluMode> gelu_mode,
    Tensor out_scale,
    OptionalTensor out_zero_point,
    std::int64_t out_quant_axis = -1,
    DataType out_dtype = DataType::Undefined,
    OptionalTensor shared_output = {}
)

Declared in ClikaRT/compute/q_tensor.h, line 1236