ClikaRT::ops::qmoe
function
2 overloads.
qmoe(QTensor, Tensor, QTensor, QTensor, …)
Tensor qmoe(
QTensor input,
Tensor router_logits,
QTensor fc1_experts,
QTensor fc2_experts,
std::int64_t top_k,
OptionalTensor fc1_bias = {},
OptionalTensor fc2_bias = {},
QTensor fc3_experts = {},
OptionalTensor fc3_bias = {},
OptionalTensor e_score_correction_bias = {},
OptionalTensor router_weights = {},
std::optional<MoeRouting> routing_mode = std::nullopt,
std::optional<bool> renormalize = std::nullopt,
std::optional<std::int64_t> n_group = std::nullopt,
std::optional<std::int64_t> topk_group = std::nullopt,
std::optional<double> routed_scaling_factor = std::nullopt,
std::optional<double> sparse_mixer_eps = std::nullopt,
std::optional<bool> apply_router_weight_on_input = std::nullopt,
std::optional<Activation> activation = std::nullopt,
std::optional<SwigluFusion> swiglu_fusion = std::nullopt,
std::optional<double> swiglu_alpha = std::nullopt,
std::optional<double> swiglu_beta = std::nullopt,
std::optional<double> swiglu_limit = std::nullopt,
std::optional<GeluMode> gelu_mode = std::nullopt,
OptionalTensor shared_output = {}
)
Declared in ClikaRT/compute/q_tensor.h, line 1225
qmoe(QTensor, Tensor, QTensor, QTensor, …)
QTensor qmoe(
QTensor input,
Tensor router_logits,
QTensor fc1_experts,
QTensor fc2_experts,
std::int64_t top_k,
OptionalTensor fc1_bias,
OptionalTensor fc2_bias,
QTensor fc3_experts,
OptionalTensor fc3_bias,
OptionalTensor e_score_correction_bias,
OptionalTensor router_weights,
std::optional<MoeRouting> routing_mode,
std::optional<bool> renormalize,
std::optional<std::int64_t> n_group,
std::optional<std::int64_t> topk_group,
std::optional<double> routed_scaling_factor,
std::optional<double> sparse_mixer_eps,
std::optional<bool> apply_router_weight_on_input,
std::optional<Activation> activation,
std::optional<SwigluFusion> swiglu_fusion,
std::optional<double> swiglu_alpha,
std::optional<double> swiglu_beta,
std::optional<double> swiglu_limit,
std::optional<GeluMode> gelu_mode,
Tensor out_scale,
OptionalTensor out_zero_point,
std::int64_t out_quant_axis = -1,
DataType out_dtype = DataType::Undefined,
OptionalTensor shared_output = {}
)
Declared in ClikaRT/compute/q_tensor.h, line 1236