MultimodalEmbeddingModel
A loaded dual-tower embedding model: texts and images share one space.
embedding_dim (property)
tokenizer (property)
embed
embed(self, texts: 'str | Sequence[str]') -> 'clika_runtime.Tensor'
embed_image
embed_image(self, image: 'clika_runtime.Tensor') -> 'clika_runtime.Tensor'
A Float32 [D] tensor for one [H, W, 3] image.