<!-- # hard line break macro for HTML -->

<div class="col-md-6 tutorials-card-container" data-tags=Gemini,Vision,Vqa,Multimodal,Plugin>

<div class="card tutorials-card" link=models/google_Gemini_Vision.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>google/Gemini-Vision</strong>
</div>

<p class="card-summary">Gemini Vision remote model for VQA via Google Gemini API</p>

<p class="tags">Gemini,Vision,Vqa,Multimodal,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Detection,Keypoints,Grounding,Ocr,Layout,Gui,PyTorch,Zero-shot,Image,Video,Vlm,Open-vocabulary,Plugin>

<div class="card tutorials-card" link=models/nvidia_LocateAnything_3B.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>nvidia/LocateAnything-3B</strong>
</div>

<p class="card-summary">NVIDIA LocateAnything-3B\\: open-vocabulary grounding VLM (3B params, Qwen2.5-3B + MoonViT + Parallel Box Decoder). Image and (frame-sampled) video. 7 operations\\: detect, grounding, point, scene_text, layout, text_grounding, gui_box. Returns fo.Detections or fo.Keypoints (image), {frame\\: label} (video).</p>

<p class="tags">Detection,Keypoints,Grounding,Ocr,Layout,Gui,PyTorch,Zero-shot,Image,Video,Vlm,Open-vocabulary,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Vlm,Zero-shot,Plugin>

<div class="card tutorials-card" link=models/google_medgemma_4b_it.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>google/medgemma-4b-it</strong>
</div>

<p class="card-summary">MedGemma is a collection of Gemma 3 variants that are trained for performance on medical text and image comprehension</p>

<p class="tags">Vlm,Zero-shot,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Embeddings,Heatmap,Plugin>

<div class="card tutorials-card" link=models/nv_labs_c_radio_v4_h.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>nv_labs/c-radio_v4-h</strong>
</div>

<p class="card-summary">C-RADIOv4-H (631M params) - Visual feature extraction model using multi-teacher distillation from SigLIP2, DINOv3, and SAM3. Generates image embeddings and spatial attention features.</p>

<p class="tags">Embeddings,Heatmap,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Embeddings,Heatmap,Plugin>

<div class="card tutorials-card" link=models/nv_labs_c_radio_v4_so400m.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>nv_labs/c-radio_v4-so400m</strong>
</div>

<p class="card-summary">C-RADIOv4-SO400M (412M params) - Efficient visual feature extraction model. Competitive with ViT-H at lower computational cost.</p>

<p class="tags">Embeddings,Heatmap,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Classification,Logits,Embeddings,PyTorch,Visual-document-retrieval,Zero-shot,Plugin>

<div class="card tutorials-card" link=models/vidore_colqwen2_5_v0_2.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>vidore/colqwen2.5-v0.2</strong>
</div>

<p class="card-summary">ColQwen is a model based on a novel model architecture and training strategy based on Vision Language Models (VLMs) to efficiently index documents from their visual features. It is a Qwen2.5-VL-3B extension that generates ColBERT- style multi-vector representations of text and images.</p>

<p class="tags">Classification,Logits,Embeddings,PyTorch,Visual-document-retrieval,Zero-shot,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Ocr,Document-understanding,Vlm,Vision-language,Plugin>

<div class="card tutorials-card" link=models/allenai_olmOCR_2_7B_1025.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>allenai/olmOCR-2-7B-1025</strong>
</div>

<p class="card-summary">olmOCR-2 is an advanced OCR model from AllenAI that uses Qwen2.5-VL architecture for document text extraction. Returns markdown output with YAML front matter containing document metadata (language, rotation, tables, diagrams). Converts equations to LaTeX and tables to HTML.</p>

<p class="tags">Ocr,Document-understanding,Vlm,Vision-language,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Classification,PyTorch,Zero-shot,Video,Embeddings,Plugin>

<div class="card tutorials-card" link=models/Qwen_Qwen3_VL_Embedding_8B.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>Qwen/Qwen3-VL-Embedding-8B</strong>
</div>

<p class="card-summary">Qwen3-VL-Embedding Specifically designed for multimodal information retrieval and cross-modal understanding, this suite accepts diverse inputs including text, images, screenshots, and videos, as well as inputs containing a mixture of these modalities</p>

<p class="tags">Classification,PyTorch,Zero-shot,Video,Embeddings,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Classification,PyTorch,Zero-shot,Video,Embeddings,Plugin>

<div class="card tutorials-card" link=models/Qwen_Qwen3_VL_Embedding_2B.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>Qwen/Qwen3-VL-Embedding-2B</strong>
</div>

<p class="card-summary">Qwen3-VL-Embedding Specifically designed for multimodal information retrieval and cross-modal understanding, this suite accepts diverse inputs including text, images, screenshots, and videos, as well as inputs containing a mixture of these modalities</p>

<p class="tags">Classification,PyTorch,Zero-shot,Video,Embeddings,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Classification,Detections,PyTorch,Temporal-detections,Zero-shot,Video,Embeddings,Plugin>

<div class="card tutorials-card" link=models/Qwen_Qwen3_VL_8B_Instruct.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>Qwen/Qwen3-VL-8B-Instruct</strong>
</div>

<p class="card-summary">Qwen3-VL is a multimodal vision-language model that processes and understands both text and visual input, enabling it to analyze images, video, and perform advanced reasoning and tasks involving both modalities.</p>

<p class="tags">Classification,Detections,PyTorch,Temporal-detections,Zero-shot,Video,Embeddings,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Classification,Detections,PyTorch,Temporal-detections,Zero-shot,Video,Embeddings,Plugin>

<div class="card tutorials-card" link=models/Qwen_Qwen3_VL_4B_Instruct.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>Qwen/Qwen3-VL-4B-Instruct</strong>
</div>

<p class="card-summary">Qwen3-VL is a multimodal vision-language model that processes and understands both text and visual input, enabling it to analyze images, video, and perform advanced reasoning and tasks involving both modalities.</p>

<p class="tags">Classification,Detections,PyTorch,Temporal-detections,Zero-shot,Video,Embeddings,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Classification,Detections,PyTorch,Temporal-detections,Zero-shot,Video,Embeddings,Plugin>

<div class="card tutorials-card" link=models/Qwen_Qwen3_VL_2B_Instruct.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>Qwen/Qwen3-VL-2B-Instruct</strong>
</div>

<p class="card-summary">Qwen3-VL is a multimodal vision-language model that processes and understands both text and visual input, enabling it to analyze images, video, and perform advanced reasoning and tasks involving both modalities.</p>

<p class="tags">Classification,Detections,PyTorch,Temporal-detections,Zero-shot,Video,Embeddings,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Classification,Logits,Embeddings,PyTorch,Visual-document-retrieval,Zero-shot,Plugin>

<div class="card tutorials-card" link=models/nomic_ai_nomic_embed_multimodal_7b.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>nomic-ai/nomic-embed-multimodal-7b</strong>
</div>

<p class="card-summary">nomic-embed-multimodal-7b is a dense state-of-the-art multimodal embedding model that excels at visual document retrieval tasks.</p>

<p class="tags">Classification,Logits,Embeddings,PyTorch,Visual-document-retrieval,Zero-shot,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Classification,Logits,Embeddings,PyTorch,Visual-document-retrieval,Zero-shot,Plugin>

<div class="card tutorials-card" link=models/nomic_ai_nomic_embed_multimodal_3b.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>nomic-ai/nomic-embed-multimodal-3b</strong>
</div>

<p class="card-summary">nomic-embed-multimodal-3b is a dense state-of-the-art multimodal embedding model that excels at visual document retrieval tasks.</p>

<p class="tags">Classification,Logits,Embeddings,PyTorch,Visual-document-retrieval,Zero-shot,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Depth-estimation,Video,Temporal,Heatmap,Plugin>

<div class="card tutorials-card" link=models/FriedFeid_oVDA_c16.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>FriedFeid/oVDA-c16</strong>
</div>

<p class="card-summary">Online Video Depth Anything (cache_size=16). Estimates temporally-consistent monocular depth for videos using a DINOv2 backbone with a rolling temporal cache. Outputs per-frame fo.Heatmap depth maps normalised to [0, 1].</p>

<p class="tags">Depth-estimation,Video,Temporal,Heatmap,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Depth-estimation,Video,Temporal,Heatmap,Plugin>

<div class="card tutorials-card" link=models/FriedFeid_oVDA_c8.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>FriedFeid/oVDA-c8</strong>
</div>

<p class="card-summary">Online Video Depth Anything (cache_size=8). Lighter variant with a smaller temporal cache; faster and lower memory than c16 at some cost to temporal consistency.</p>

<p class="tags">Depth-estimation,Video,Temporal,Heatmap,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Embeddings,PyTorch,Visual-document-retrieval,Zero-shot,Plugin>

<div class="card tutorials-card" link=models/jinaai_jina_embeddings_v4.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>jinaai/jina-embeddings-v4</strong>
</div>

<p class="card-summary">jina-embeddings-v4 is a universal embedding model for multimodal and multilingual retrieval. The model is specially designed for complex document retrieval, including visually rich documents with charts, tables, and illustrations.</p>

<p class="tags">Embeddings,PyTorch,Visual-document-retrieval,Zero-shot,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Detection,Segmentation,Ocr,Vlm,Zero-shot,Plugin>

<div class="card tutorials-card" link=models/moondream_moondream3_preview.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>moondream/moondream3-preview</strong>
</div>

<p class="card-summary">Moondream 3 (Preview) is an vision language model with a mixture-of-experts architecture (9B total parameters, 2B active).</p>

<p class="tags">Detection,Segmentation,Ocr,Vlm,Zero-shot,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Embeddings,Heatmap,Plugin>

<div class="card tutorials-card" link=models/nv_labs_c_radio_v3_g.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>nv_labs/c-radio_v3-g</strong>
</div>

<p class="card-summary">C-RADIOv3-g model (ViT-H/14)</p>

<p class="tags">Embeddings,Heatmap,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Embeddings,Heatmap,Plugin>

<div class="card tutorials-card" link=models/nv_labs_c_radio_v3_h.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>nv_labs/c-radio_v3-h</strong>
</div>

<p class="card-summary">C-RADIOv3-H model (ViT-H/16)</p>

<p class="tags">Embeddings,Heatmap,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Embeddings,Heatmap,Plugin>

<div class="card tutorials-card" link=models/nv_labs_c_radio_v3_l.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>nv_labs/c-radio_v3-l</strong>
</div>

<p class="card-summary">C-RADIOv3-L model (ViT-L/16))</p>

<p class="tags">Embeddings,Heatmap,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Embeddings,Heatmap,Plugin>

<div class="card tutorials-card" link=models/nv_labs_c_radio_v3_b.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>nv_labs/c-radio_v3-b</strong>
</div>

<p class="card-summary">C-RADIOv3-B model (ViT-B/16)</p>

<p class="tags">Embeddings,Heatmap,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Detection,Classification,Keypoints,Vqa,Temporal-detections,PyTorch,Zero-shot,Image,Video,3d-detection,Plugin>

<div class="card tutorials-card" link=models/Qwen_Qwen3_5_35B_A3B_FP8.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>Qwen/Qwen3.5-35B-A3B-FP8</strong>
</div>

<p class="card-summary">Qwen3.5 is a multimodal vision-language model supporting images and videos. Image operations\\: detect, point, classify, vqa, detect_3d. Video operations\\: description, temporal_localization, tracking, ocr, comprehensive, custom.</p>

<p class="tags">Detection,Classification,Keypoints,Vqa,Temporal-detections,PyTorch,Zero-shot,Image,Video,3d-detection,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Detection,Classification,Keypoints,Vqa,Temporal-detections,PyTorch,Zero-shot,Image,Video,3d-detection,Plugin>

<div class="card tutorials-card" link=models/Qwen_Qwen3_5_27B.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>Qwen/Qwen3.5-27B</strong>
</div>

<p class="card-summary">Qwen3.5 is a multimodal vision-language model supporting images and videos. Image operations\\: detect, point, classify, vqa, detect_3d. Video operations\\: description, temporal_localization, tracking, ocr, comprehensive, custom.</p>

<p class="tags">Detection,Classification,Keypoints,Vqa,Temporal-detections,PyTorch,Zero-shot,Image,Video,3d-detection,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Detection,Classification,Keypoints,Vqa,Temporal-detections,PyTorch,Zero-shot,Image,Video,3d-detection,Plugin>

<div class="card tutorials-card" link=models/Qwen_Qwen3_5_27B_FP8.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>Qwen/Qwen3.5-27B-FP8</strong>
</div>

<p class="card-summary">Qwen3.5 is a multimodal vision-language model supporting images and videos. Image operations\\: detect, point, classify, vqa, detect_3d. Video operations\\: description, temporal_localization, tracking, ocr, comprehensive, custom.</p>

<p class="tags">Detection,Classification,Keypoints,Vqa,Temporal-detections,PyTorch,Zero-shot,Image,Video,3d-detection,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Detection,Classification,Keypoints,Vqa,Temporal-detections,PyTorch,Zero-shot,Image,Video,3d-detection,Plugin>

<div class="card tutorials-card" link=models/Qwen_Qwen3_5_9B.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>Qwen/Qwen3.5-9B</strong>
</div>

<p class="card-summary">Qwen3.5 is a multimodal vision-language model supporting images and videos. Image operations\\: detect, point, classify, vqa, detect_3d. Video operations\\: description, temporal_localization, tracking, ocr, comprehensive, custom.</p>

<p class="tags">Detection,Classification,Keypoints,Vqa,Temporal-detections,PyTorch,Zero-shot,Image,Video,3d-detection,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Detection,Classification,Keypoints,Vqa,Temporal-detections,PyTorch,Zero-shot,Image,Video,3d-detection,Plugin>

<div class="card tutorials-card" link=models/Qwen_Qwen3_5_4B.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>Qwen/Qwen3.5-4B</strong>
</div>

<p class="card-summary">Qwen3.5 is a multimodal vision-language model supporting images and videos. Image operations\\: detect, point, classify, vqa, detect_3d. Video operations\\: description, temporal_localization, tracking, ocr, comprehensive, custom.</p>

<p class="tags">Detection,Classification,Keypoints,Vqa,Temporal-detections,PyTorch,Zero-shot,Image,Video,3d-detection,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Detection,Classification,Keypoints,Vqa,Temporal-detections,PyTorch,Zero-shot,Image,Video,3d-detection,Plugin>

<div class="card tutorials-card" link=models/Qwen_Qwen3_5_2B.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>Qwen/Qwen3.5-2B</strong>
</div>

<p class="card-summary">Qwen3.5 is a multimodal vision-language model supporting images and videos. Image operations\\: detect, point, classify, vqa, detect_3d. Video operations\\: description, temporal_localization, tracking, ocr, comprehensive, custom.</p>

<p class="tags">Detection,Classification,Keypoints,Vqa,Temporal-detections,PyTorch,Zero-shot,Image,Video,3d-detection,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Detection,Classification,Keypoints,Vqa,Temporal-detections,PyTorch,Zero-shot,Image,Video,3d-detection,Plugin>

<div class="card tutorials-card" link=models/Qwen_Qwen3_5_0_8B.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>Qwen/Qwen3.5-0.8B</strong>
</div>

<p class="card-summary">Qwen3.5 is a multimodal vision-language model supporting images and videos. Image operations\\: detect, point, classify, vqa, detect_3d. Video operations\\: description, temporal_localization, tracking, ocr, comprehensive, custom.</p>

<p class="tags">Detection,Classification,Keypoints,Vqa,Temporal-detections,PyTorch,Zero-shot,Image,Video,3d-detection,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Detection,Classification,Keypoints,Vqa,Temporal-detections,PyTorch,Zero-shot,Image,Video,Vlm,Plugin>

<div class="card tutorials-card" link=models/google_gemma_4_E2B_it.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>google/gemma-4-E2B-it</strong>
</div>

<p class="card-summary">Gemma 4 E2B is a 2.3B effective parameter multimodal model supporting text, image, video, and audio. Image operations\\: detect, point, classify, vqa. Video operations\\: description, temporal_localization, tracking, ocr, comprehensive, custom.</p>

<p class="tags">Detection,Classification,Keypoints,Vqa,Temporal-detections,PyTorch,Zero-shot,Image,Video,Vlm,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Detection,Classification,Keypoints,Vqa,Temporal-detections,PyTorch,Zero-shot,Image,Video,Vlm,Plugin>

<div class="card tutorials-card" link=models/google_gemma_4_E4B_it.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>google/gemma-4-E4B-it</strong>
</div>

<p class="card-summary">Gemma 4 E4B is a 4.5B effective parameter multimodal model supporting text, image, video, and audio. Image operations\\: detect, point, classify, vqa. Video operations\\: description, temporal_localization, tracking, ocr, comprehensive, custom.</p>

<p class="tags">Detection,Classification,Keypoints,Vqa,Temporal-detections,PyTorch,Zero-shot,Image,Video,Vlm,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Detection,Classification,Keypoints,Vqa,PyTorch,Zero-shot,Image,Vlm,Plugin>

<div class="card tutorials-card" link=models/google_gemma_4_26B_A4B_it.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>google/gemma-4-26B-A4B-it</strong>
</div>

<p class="card-summary">Gemma 4 26B-A4B is a 3.8B active parameter (25.2B total) MoE multimodal model supporting text and image. Image operations\\: detect, point, classify, vqa. No video support.</p>

<p class="tags">Detection,Classification,Keypoints,Vqa,PyTorch,Zero-shot,Image,Vlm,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Detection,Classification,Keypoints,Vqa,PyTorch,Zero-shot,Image,Vlm,Plugin>

<div class="card tutorials-card" link=models/google_gemma_4_31B_it.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>google/gemma-4-31B-it</strong>
</div>

<p class="card-summary">Gemma 4 31B is a 30.7B dense multimodal model supporting text and image. Image operations\\: detect, point, classify, vqa. No video support.</p>

<p class="tags">Detection,Classification,Keypoints,Vqa,PyTorch,Zero-shot,Image,Vlm,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Detection,Ocr,Vlm,Classification,Zero-shot,Plugin>

<div class="card tutorials-card" link=models/PerceptronAI_Isaac_0_2_2B_Preview.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>PerceptronAI/Isaac-0.2-2B-Preview</strong>
</div>

<p class="card-summary">Isaac 0.2 2B (Preview) is an open-source, 2B-parameter model built for real-world applications. Isaac 0.2 is part of Perceptron AI's family of models built to be the intelligence layer for the physical world.</p>

<p class="tags">Detection,Ocr,Vlm,Classification,Zero-shot,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Detection,Ocr,Vlm,Classification,Zero-shot,Plugin>

<div class="card tutorials-card" link=models/PerceptronAI_Isaac_0_2_1B.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>PerceptronAI/Isaac-0.2-1B</strong>
</div>

<p class="card-summary">Isaac 0.2 1B is an open-source, 1B-parameter model built for real-world applications. Isaac 0.2 is part of Perceptron AI's family of models built to be the intelligence layer for the physical world.</p>

<p class="tags">Detection,Ocr,Vlm,Classification,Zero-shot,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Keypoints,Pointing,Tracking,Video,Vlm,Zero-shot,Image-text-to-text,Plugin>

<div class="card tutorials-card" link=models/allenai_MolmoPoint_8B.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>allenai/MolmoPoint-8B</strong>
</div>

<p class="card-summary">MolmoPoint-8B is a vision-language model that locates and tracks objects in images and videos by pointing. For images, it returns normalized keypoint coordinates per instance. For videos, it supports frame-level tracking (follows objects over time) and sparse pointing (identifies objects across sampled frames).</p>

<p class="tags">Keypoints,Pointing,Tracking,Video,Vlm,Zero-shot,Image-text-to-text,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Keypoints,Pointing,Tracking,Video,Vlm,Zero-shot,Image-text-to-text,Plugin>

<div class="card tutorials-card" link=models/allenai_MolmoPoint_Vid_4B.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>allenai/MolmoPoint-Vid-4B</strong>
</div>

<p class="card-summary">MolmoPoint-Vid-4B is a 4B vision-language model specialised for video pointing and tracking. Given a text prompt, it returns keypoint coordinates for each matching object across video frames. Supports frame-level tracking and sparse pointing modes.</p>

<p class="tags">Keypoints,Pointing,Tracking,Video,Vlm,Zero-shot,Image-text-to-text,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Keypoints,Pointing,Vlm,Zero-shot,Image-text-to-text,Ui,Screenshots,Plugin>

<div class="card tutorials-card" link=models/allenai_MolmoPoint_Img_8B.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>allenai/MolmoPoint-Img-8B</strong>
</div>

<p class="card-summary">MolmoPoint-Img-8B is a vision-language model specialised for pointing at UI elements and objects in screenshots. Given a text prompt, it returns normalized keypoint coordinates for each matching element found.</p>

<p class="tags">Keypoints,Pointing,Vlm,Zero-shot,Image-text-to-text,Ui,Screenshots,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Ocr,Text-extraction,Vlm,Document-understanding,Plugin>

<div class="card tutorials-card" link=models/lightonai_LightOnOCR_2_1B.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>lightonai/LightOnOCR-2-1B</strong>
</div>

<p class="card-summary">LightOnOCR is a 2.1B-parameter vision-language model optimized for optical character recognition. It uses a chat-based interface to extract text from images with high accuracy across various document types, handwritten text, and scene text.</p>

<p class="tags">Ocr,Text-extraction,Vlm,Document-understanding,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Agentic,Detection,Ocr,Vlm,Classification,Zero-shot,Visual-agent,Plugin>

<div class="card tutorials-card" link=models/moonshotai_Kimi_VL_A3B_Instruct.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>moonshotai/Kimi-VL-A3B-Instruct</strong>
</div>

<p class="card-summary">Kimi-VL is an efficient open-source Mixture-of-Experts (MoE) vision-language model (VLM) that offers advanced multimodal reasoning, long-context understanding, and strong agent capabilities—all while activating only 2.8B parameters in its language decoder</p>

<p class="tags">Agentic,Detection,Ocr,Vlm,Classification,Zero-shot,Visual-agent,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Agentic,Detection,Segmentation,Ocr,Vlm,Zero-shot,Visual-agent,Plugin>

<div class="card tutorials-card" link=models/moonshotai_Kimi_VL_A3B_Thinking.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>moonshotai/Kimi-VL-A3B-Thinking</strong>
</div>

<p class="card-summary">Kimi-VL is an efficient open-source Mixture-of-Experts (MoE) vision-language model (VLM) that offers advanced multimodal reasoning, long-context understanding, and strong agent capabilities—all while activating only 2.8B parameters in its language decoder</p>

<p class="tags">Agentic,Detection,Segmentation,Ocr,Vlm,Zero-shot,Visual-agent,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Agentic,Detection,Segmentation,Ocr,Vlm,Zero-shot,Visual-agent,Plugin>

<div class="card tutorials-card" link=models/moonshotai_Kimi_VL_A3B_Thinking_2506.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>moonshotai/Kimi-VL-A3B-Thinking-2506</strong>
</div>

<p class="card-summary">Kimi-VL is an efficient open-source Mixture-of-Experts (MoE) vision-language model (VLM) that offers advanced multimodal reasoning, long-context understanding, and strong agent capabilities—all while activating only 2.8B parameters in its language decoder</p>

<p class="tags">Agentic,Detection,Segmentation,Ocr,Vlm,Zero-shot,Visual-agent,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Classification,Logits,Embeddings,PyTorch,Clip,Zero-shot,Plugin>

<div class="card tutorials-card" link=models/google_siglip2_base_patch16_224.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>google/siglip2-base-patch16-224</strong>
</div>

<p class="card-summary">SigLIP 2 extends the pretraining objective of SigLIP with prior, independently developed techniques into a unified recipe, for improved semantic understanding, localization, and dense features.</p>

<p class="tags">Classification,Logits,Embeddings,PyTorch,Clip,Zero-shot,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Classification,Logits,Embeddings,PyTorch,Clip,Zero-shot,Plugin>

<div class="card tutorials-card" link=models/google_siglip2_base_patch16_256.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>google/siglip2-base-patch16-256</strong>
</div>

<p class="card-summary">SigLIP 2 extends the pretraining objective of SigLIP with prior, independently developed techniques into a unified recipe, for improved semantic understanding, localization, and dense features.</p>

<p class="tags">Classification,Logits,Embeddings,PyTorch,Clip,Zero-shot,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Classification,Logits,Embeddings,PyTorch,Clip,Zero-shot,Plugin>

<div class="card tutorials-card" link=models/google_siglip2_base_patch16_384.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>google/siglip2-base-patch16-384</strong>
</div>

<p class="card-summary">SigLIP 2 extends the pretraining objective of SigLIP with prior, independently developed techniques into a unified recipe, for improved semantic understanding, localization, and dense features.</p>

<p class="tags">Classification,Logits,Embeddings,PyTorch,Clip,Zero-shot,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Classification,Logits,Embeddings,PyTorch,Clip,Zero-shot,Plugin>

<div class="card tutorials-card" link=models/google_siglip2_base_patch16_512.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>google/siglip2-base-patch16-512</strong>
</div>

<p class="card-summary">SigLIP 2 extends the pretraining objective of SigLIP with prior, independently developed techniques into a unified recipe, for improved semantic understanding, localization, and dense features.</p>

<p class="tags">Classification,Logits,Embeddings,PyTorch,Clip,Zero-shot,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Classification,Logits,Embeddings,PyTorch,Clip,Zero-shot,Plugin>

<div class="card tutorials-card" link=models/google_siglip2_large_patch16_256.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>google/siglip2-large-patch16-256</strong>
</div>

<p class="card-summary">SigLIP 2 extends the pretraining objective of SigLIP with prior, independently developed techniques into a unified recipe, for improved semantic understanding, localization, and dense features.</p>

<p class="tags">Classification,Logits,Embeddings,PyTorch,Clip,Zero-shot,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Classification,Logits,Embeddings,PyTorch,Clip,Zero-shot,Plugin>

<div class="card tutorials-card" link=models/google_siglip2_large_patch16_384.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>google/siglip2-large-patch16-384</strong>
</div>

<p class="card-summary">SigLIP 2 extends the pretraining objective of SigLIP with prior, independently developed techniques into a unified recipe, for improved semantic understanding, localization, and dense features.</p>

<p class="tags">Classification,Logits,Embeddings,PyTorch,Clip,Zero-shot,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Classification,Logits,Embeddings,PyTorch,Clip,Zero-shot,Plugin>

<div class="card tutorials-card" link=models/google_siglip2_large_patch16_512.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>google/siglip2-large-patch16-512</strong>
</div>

<p class="card-summary">SigLIP 2 extends the pretraining objective of SigLIP with prior, independently developed techniques into a unified recipe, for improved semantic understanding, localization, and dense features.</p>

<p class="tags">Classification,Logits,Embeddings,PyTorch,Clip,Zero-shot,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Classification,Logits,Embeddings,PyTorch,Clip,Zero-shot,Plugin>

<div class="card tutorials-card" link=models/google_siglip2_base_patch32_256.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>google/siglip2-base-patch32-256</strong>
</div>

<p class="card-summary">SigLIP 2 extends the pretraining objective of SigLIP with prior, independently developed techniques into a unified recipe, for improved semantic understanding, localization, and dense features.</p>

<p class="tags">Classification,Logits,Embeddings,PyTorch,Clip,Zero-shot,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Classification,Logits,Embeddings,PyTorch,Clip,Zero-shot,Plugin>

<div class="card tutorials-card" link=models/google_siglip2_giant_opt_patch16_256.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>google/siglip2-giant-opt-patch16-256</strong>
</div>

<p class="card-summary">SigLIP 2 extends the pretraining objective of SigLIP with prior, independently developed techniques into a unified recipe, for improved semantic understanding, localization, and dense features.</p>

<p class="tags">Classification,Logits,Embeddings,PyTorch,Clip,Zero-shot,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Classification,Logits,Embeddings,PyTorch,Clip,Zero-shot,Plugin>

<div class="card tutorials-card" link=models/google_siglip2_giant_opt_patch16_384.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>google/siglip2-giant-opt-patch16-384</strong>
</div>

<p class="card-summary">SigLIP 2 extends the pretraining objective of SigLIP with prior, independently developed techniques into a unified recipe, for improved semantic understanding, localization, and dense features.</p>

<p class="tags">Classification,Logits,Embeddings,PyTorch,Clip,Zero-shot,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Classification,Logits,Embeddings,PyTorch,Clip,Zero-shot,Plugin>

<div class="card tutorials-card" link=models/google_siglip2_so400m_patch14_224.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>google/siglip2-so400m-patch14-224</strong>
</div>

<p class="card-summary">SigLIP 2 extends the pretraining objective of SigLIP with prior, independently developed techniques into a unified recipe, for improved semantic understanding, localization, and dense features.</p>

<p class="tags">Classification,Logits,Embeddings,PyTorch,Clip,Zero-shot,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Classification,Logits,Embeddings,PyTorch,Clip,Zero-shot,Plugin>

<div class="card tutorials-card" link=models/google_siglip2_so400m_patch14_384.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>google/siglip2-so400m-patch14-384</strong>
</div>

<p class="card-summary">SigLIP 2 extends the pretraining objective of SigLIP with prior, independently developed techniques into a unified recipe, for improved semantic understanding, localization, and dense features.</p>

<p class="tags">Classification,Logits,Embeddings,PyTorch,Clip,Zero-shot,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Classification,Logits,Embeddings,PyTorch,Clip,Zero-shot,Plugin>

<div class="card tutorials-card" link=models/google_siglip2_so400m_patch16_256.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>google/siglip2-so400m-patch16-256</strong>
</div>

<p class="card-summary">SigLIP 2 extends the pretraining objective of SigLIP with prior, independently developed techniques into a unified recipe, for improved semantic understanding, localization, and dense features.</p>

<p class="tags">Classification,Logits,Embeddings,PyTorch,Clip,Zero-shot,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Classification,Logits,Embeddings,PyTorch,Clip,Zero-shot,Plugin>

<div class="card tutorials-card" link=models/google_siglip2_so400m_patch16_384.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>google/siglip2-so400m-patch16-384</strong>
</div>

<p class="card-summary">SigLIP 2 extends the pretraining objective of SigLIP with prior, independently developed techniques into a unified recipe, for improved semantic understanding, localization, and dense features.</p>

<p class="tags">Classification,Logits,Embeddings,PyTorch,Clip,Zero-shot,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Classification,Logits,Embeddings,PyTorch,Clip,Zero-shot,Plugin>

<div class="card tutorials-card" link=models/google_siglip2_so400m_patch16_512.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>google/siglip2-so400m-patch16-512</strong>
</div>

<p class="card-summary">SigLIP 2 extends the pretraining objective of SigLIP with prior, independently developed techniques into a unified recipe, for improved semantic understanding, localization, and dense features.</p>

<p class="tags">Classification,Logits,Embeddings,PyTorch,Clip,Zero-shot,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Classification,Logits,Embeddings,PyTorch,Clip,Zero-shot,Plugin>

<div class="card tutorials-card" link=models/google_siglip2_base_patch16_naflex.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>google/siglip2-base-patch16-naflex</strong>
</div>

<p class="card-summary">SigLIP 2 extends the pretraining objective of SigLIP with prior, independently developed techniques into a unified recipe, for improved semantic understanding, localization, and dense features.</p>

<p class="tags">Classification,Logits,Embeddings,PyTorch,Clip,Zero-shot,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Classification,Logits,Embeddings,PyTorch,Clip,Zero-shot,Plugin>

<div class="card tutorials-card" link=models/google_siglip2_so400m_patch16_naflex.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>google/siglip2-so400m-patch16-naflex</strong>
</div>

<p class="card-summary">SigLIP 2 extends the pretraining objective of SigLIP with prior, independently developed techniques into a unified recipe, for improved semantic understanding, localization, and dense features.</p>

<p class="tags">Classification,Logits,Embeddings,PyTorch,Clip,Zero-shot,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=PyTorch,Keypoints,Zero-shot,Video,Plugin>

<div class="card tutorials-card" link=models/allenai_Molmo2_4B.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>allenai/Molmo2-4B</strong>
</div>

<p class="card-summary">Molmo2 is a family of open vision-language models developed by the Allen Institute for AI (Ai2) that support image, video and multi-image understanding and grounding.</p>

<p class="tags">PyTorch,Keypoints,Zero-shot,Video,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=PyTorch,Keypoints,Zero-shot,Video,Plugin>

<div class="card tutorials-card" link=models/allenai_Molmo2_O_7B.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>allenai/Molmo2-O-7B</strong>
</div>

<p class="card-summary">Molmo2 is a family of open vision-language models developed by the Allen Institute for AI (Ai2) that support image, video and multi-image understanding and grounding.</p>

<p class="tags">PyTorch,Keypoints,Zero-shot,Video,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=PyTorch,Keypoints,Zero-shot,Video,Plugin>

<div class="card tutorials-card" link=models/allenai_Molmo2_8B.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>allenai/Molmo2-8B</strong>
</div>

<p class="card-summary">Molmo2 is a family of open vision-language models developed by the Allen Institute for AI (Ai2) that support image, video and multi-image understanding and grounding.</p>

<p class="tags">PyTorch,Keypoints,Zero-shot,Video,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=PyTorch,Keypoints,Zero-shot,Video,Plugin>

<div class="card tutorials-card" link=models/allenai_Molmo2_VideoPoint_4B.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>allenai/Molmo2-VideoPoint-4B</strong>
</div>

<p class="card-summary">Molmo2 is a family of open vision-language models developed by the Allen Institute for AI (Ai2) that support image, video and multi-image understanding and grounding.</p>

<p class="tags">PyTorch,Keypoints,Zero-shot,Video,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Embeddings,PyTorch,Zero-shot,Segmentation,Segment-anything,Detections,Instance-segmentation,Visual-prompting,Plugin>

<div class="card tutorials-card" link=models/facebook_sam3.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>facebook/sam3</strong>
</div>

<p class="card-summary">SAM3 (Segment Anything Model 3) performs promptable segmentation on images using text or visual prompts. Supports concept segmentation (find all instances), visual segmentation (specific instances), automatic segmentation, and visual embeddings.</p>

<p class="tags">Embeddings,PyTorch,Zero-shot,Segmentation,Segment-anything,Detections,Instance-segmentation,Visual-prompting,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Vision-language,Vqa,Multimodal,Transformers,PyTorch,Plugin>

<div class="card tutorials-card" link=models/apple_FastVLM_0_5B.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>apple/FastVLM-0.5B</strong>
</div>

<p class="card-summary">FastVLM is a vision-language model from Apple that excels at visual question answering and image classification tasks. It supports both zero-shot classification and open-ended VQA with customizable prompts.</p>

<p class="tags">Vision-language,Vqa,Multimodal,Transformers,PyTorch,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Vision-language,Vqa,Multimodal,Transformers,PyTorch,Plugin>

<div class="card tutorials-card" link=models/apple_FastVLM_1_5B.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>apple/FastVLM-1.5B</strong>
</div>

<p class="card-summary">FastVLM is a vision-language model from Apple that excels at visual question answering and image classification tasks. It supports both zero-shot classification and open-ended VQA with customizable prompts.</p>

<p class="tags">Vision-language,Vqa,Multimodal,Transformers,PyTorch,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Vision-language,Vqa,Multimodal,Transformers,PyTorch,Plugin>

<div class="card tutorials-card" link=models/apple_FastVLM_7B.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>apple/FastVLM-7B</strong>
</div>

<p class="card-summary">FastVLM is a vision-language model from Apple that excels at visual question answering and image classification tasks. It supports both zero-shot classification and open-ended VQA with customizable prompts.</p>

<p class="tags">Vision-language,Vqa,Multimodal,Transformers,PyTorch,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Ocr,Document-understanding,Visual-document-retrieval,Plugin>

<div class="card tutorials-card" link=models/zai_org_GLM_OCR.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>zai-org/GLM-OCR</strong>
</div>

<p class="card-summary">GLM-OCR is a vision-language model for document understanding. Supports text recognition, formula recognition, table recognition, and custom structured extraction via JSON prompts.</p>

<p class="tags">Ocr,Document-understanding,Visual-document-retrieval,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Keypoints,Visual-agent,Plugin>

<div class="card tutorials-card" link=models/microsoft_GUI_Actor_3B_Qwen2_5_VL.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>microsoft/GUI-Actor-3B-Qwen2.5-VL</strong>
</div>

<p class="card-summary">GUI-Actor is Coordinate-Free Visual Grounding for GUI Agents</p>

<p class="tags">Keypoints,Visual-agent,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Keypoints,Visual-agent,Plugin>

<div class="card tutorials-card" link=models/microsoft_GUI_Actor_7B_Qwen2_5_VL.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>microsoft/GUI-Actor-7B-Qwen2.5-VL</strong>
</div>

<p class="card-summary">GUI-Actor is Coordinate-Free Visual Grounding for GUI Agents</p>

<p class="tags">Keypoints,Visual-agent,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Vlm,Zero-shot,Plugin>

<div class="card tutorials-card" link=models/google_medgemma_1_5_4b_it.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>google/medgemma-1.5-4b-it</strong>
</div>

<p class="card-summary">MedGemma 1.5 4B is an updated version of the MedGemma 1 4B model. MedGemma is a collection of Gemma 3 variants that are trained for performance on medical text and image comprehension</p>

<p class="tags">Vlm,Zero-shot,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Detection,Ocr,Vlm,Classification,Zero-shot,Plugin>

<div class="card tutorials-card" link=models/PerceptronAI_Isaac_0_1.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>PerceptronAI/Isaac-0.1</strong>
</div>

<p class="card-summary">Isaac 0.1 is an open-source, 2B-parameter model built for real-world applications. Isaac 0.1 is the first in Perceptron AI's family of models built to be the intelligence layer for the physical world.</p>

<p class="tags">Detection,Ocr,Vlm,Classification,Zero-shot,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Threed,Plugin>

<div class="card tutorials-card" link=models/Apple_SHARP.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>Apple/SHARP</strong>
</div>

<p class="card-summary">SHARP is an approach to photorealistic view synthesis from a single image. Given a single photograph, SHARP regresses the parameters of a 3D Gaussian representation of the depicted scene.</p>

<p class="tags">Threed,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Detection,Ocr,Vlm,Plugin>

<div class="card tutorials-card" link=models/opendatalab_MinerU2_5_2509_1_2B.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>opendatalab/MinerU2.5-2509-1.2B</strong>
</div>

<p class="card-summary">MinerU2.5 is a 1.2B-parameter vision-language model for document parsing. It adopts a two-stage parsing strategy\\: first conducting efficient global layout analysis on downsampled images, then performing fine-grained content recognition on native-resolution crops for text, formulas, and tables.</p>

<p class="tags">Detection,Ocr,Vlm,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Detection,Ocr,Vlm,Classification,Zero-shot,Visual-agent,Plugin>

<div class="card tutorials-card" link=models/nvidia_Llama_3_1_Nemotron_Nano_VL_8B_V1.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>nvidia/Llama-3.1-Nemotron-Nano-VL-8B-V1</strong>
</div>

<p class="card-summary">Llama Nemotron Nano VL is a leading document intelligence vision language model (VLMs) that enables the ability to query and summarize images from the physical or virtual world.</p>

<p class="tags">Detection,Ocr,Vlm,Classification,Zero-shot,Visual-agent,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Depth,Threed,Keypoints,Plugin>

<div class="card tutorials-card" link=models/facebook_VGGT_1B.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>facebook/VGGT-1B</strong>
</div>

<p class="card-summary">Visual Geometry Grounded Transformer (VGGT) is a feed-forward neural network that directly infers all key 3D attributes of a scene.</p>

<p class="tags">Depth,Threed,Keypoints,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Classification,Logits,Embeddings,PyTorch,Clip,Zero-shot,Plugin>

<div class="card tutorials-card" link=models/google_medsiglip_448.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>google/medsiglip-448</strong>
</div>

<p class="card-summary">MedSigLIP is a variant of SigLIP that is trained to encode medical images and text into a common embedding space.</p>

<p class="tags">Classification,Logits,Embeddings,PyTorch,Clip,Zero-shot,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Detection,Ocr,Vlm,Plugin>

<div class="card tutorials-card" link=models/nanonets_Nanonets_OCR2_3B.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>nanonets/Nanonets-OCR2-3B</strong>
</div>

<p class="card-summary">Nanonets-OCR2 are image-to-markdown OCR models that go far beyond traditional text extraction. It transforms documents into structured markdown with intelligent content recognition and semantic tagging, making it ideal for downstream processing by Large Language Models (LLMs).</p>

<p class="tags">Detection,Ocr,Vlm,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Detection,Ocr,Vlm,Plugin>

<div class="card tutorials-card" link=models/deepseek_ai_DeepSeek_OCR.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>deepseek-ai/DeepSeek-OCR</strong>
</div>

<p class="card-summary">DeepSeek-OCR is an open-source vision-language model (VLM) developed by DeepSeek to perform optical character recognition (OCR) and context compression for long and complex documents</p>

<p class="tags">Detection,Ocr,Vlm,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Detection,Ocr,Vlm,Plugin>

<div class="card tutorials-card" link=models/microsoft_kosmos_2_5.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>microsoft/kosmos-2.5</strong>
</div>

<p class="card-summary">Kosmos-2.5 is a multimodal literate model for machine reading of text-intensive images.</p>

<p class="tags">Detection,Ocr,Vlm,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Classification,Logits,Embeddings,PyTorch,Visual-document-retrieval,Zero-shot,Plugin>

<div class="card tutorials-card" link=models/ModernVBERT_bimodernvbert.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>ModernVBERT/bimodernvbert</strong>
</div>

<p class="card-summary">The ModernVBERT suite is a suite of compact 250M-parameter vision-language encoders. BiModernVBERT is the bi-encoder version that is fine-tuned for visual document retrieval tasks.</p>

<p class="tags">Classification,Logits,Embeddings,PyTorch,Visual-document-retrieval,Zero-shot,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Classification,Logits,Embeddings,PyTorch,Visual-document-retrieval,Zero-shot,Plugin>

<div class="card tutorials-card" link=models/ModernVBERT_colmodernvbert.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>ModernVBERT/colmodernvbert</strong>
</div>

<p class="card-summary">The ModernVBERT suite is a suite of compact 250M-parameter vision-language encoders. ColModernVBERT is the late-interaction version that is fine-tuned for visual document retrieval tasks, the most performant model on this task.</p>

<p class="tags">Classification,Logits,Embeddings,PyTorch,Visual-document-retrieval,Zero-shot,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Detection,Ocr,Vlm,Classification,Zero-shot,Visual-agent,Plugin>

<div class="card tutorials-card" link=models/ByteDance_Seed_UI_TARS_1_5_7B.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>ByteDance-Seed/UI-TARS-1.5-7B</strong>
</div>

<p class="card-summary">UI-TARS-1.5 is an open-source multimodal agent capable of effectively performing diverse tasks within virtual worlds.</p>

<p class="tags">Detection,Ocr,Vlm,Classification,Zero-shot,Visual-agent,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Classification,Logits,Embeddings,PyTorch,Visual-document-retrieval,Zero-shot,Plugin>

<div class="card tutorials-card" link=models/vidore_colpali_v1_3_merged.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>vidore/colpali-v1.3-merged</strong>
</div>

<p class="card-summary">ColPali is a model based on a novel model architecture and training strategy based on Vision Language Models (VLMs) to efficiently index documents from their visual features. It is a PaliGemma-3B extension that generates ColBERT- style multi-vector representations of text and images</p>

<p class="tags">Classification,Logits,Embeddings,PyTorch,Visual-document-retrieval,Zero-shot,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Detection,Segmentation,Ocr,Vlm,Zero-shot,Plugin>

<div class="card tutorials-card" link=models/google_paligemma2_3b_mix_448.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>google/paligemma2-3b-mix-448</strong>
</div>

<p class="card-summary">PaliGemma 2 mix checkpoints are fine-tuned on a diverse set of tasks and are ready to use out of the box. These tasks include short and long captioning, optical character recognition, question answering, object detection and segmentation, and more.</p>

<p class="tags">Detection,Segmentation,Ocr,Vlm,Zero-shot,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Detection,Segmentation,Ocr,Vlm,Zero-shot,Plugin>

<div class="card tutorials-card" link=models/google_paligemma2_10b_mix_448.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>google/paligemma2-10b-mix-448</strong>
</div>

<p class="card-summary">PaliGemma 2 mix checkpoints are fine-tuned on a diverse set of tasks and are ready to use out of the box. These tasks include short and long captioning, optical character recognition, question answering, object detection and segmentation, and more.</p>

<p class="tags">Detection,Segmentation,Ocr,Vlm,Zero-shot,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Detection,Segmentation,Ocr,Vlm,Zero-shot,Plugin>

<div class="card tutorials-card" link=models/google_paligemma2_28b_mix_448.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>google/paligemma2-28b-mix-448</strong>
</div>

<p class="card-summary">PaliGemma 2 mix checkpoints are fine-tuned on a diverse set of tasks and are ready to use out of the box. These tasks include short and long captioning, optical character recognition, question answering, object detection and segmentation, and more.</p>

<p class="tags">Detection,Segmentation,Ocr,Vlm,Zero-shot,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Detection,Segmentation,Ocr,Vlm,Zero-shot,Plugin>

<div class="card tutorials-card" link=models/google_paligemma2_3b_mix_224.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>google/paligemma2-3b-mix-224</strong>
</div>

<p class="card-summary">PaliGemma 2 mix checkpoints are fine-tuned on a diverse set of tasks and are ready to use out of the box. These tasks include short and long captioning, optical character recognition, question answering, object detection and segmentation, and more.</p>

<p class="tags">Detection,Segmentation,Ocr,Vlm,Zero-shot,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Detection,Segmentation,Ocr,Vlm,Zero-shot,Plugin>

<div class="card tutorials-card" link=models/google_paligemma2_10b_mix_224.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>google/paligemma2-10b-mix-224</strong>
</div>

<p class="card-summary">PaliGemma 2 mix checkpoints are fine-tuned on a diverse set of tasks and are ready to use out of the box. These tasks include short and long captioning, optical character recognition, question answering, object detection and segmentation, and more.</p>

<p class="tags">Detection,Segmentation,Ocr,Vlm,Zero-shot,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Detection,Segmentation,Ocr,Vlm,Zero-shot,Plugin>

<div class="card tutorials-card" link=models/google_paligemma2_28b_mix_224.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>google/paligemma2-28b-mix-224</strong>
</div>

<p class="card-summary">PaliGemma 2 mix checkpoints are fine-tuned on a diverse set of tasks and are ready to use out of the box. These tasks include short and long captioning, optical character recognition, question answering, object detection and segmentation, and more.</p>

<p class="tags">Detection,Segmentation,Ocr,Vlm,Zero-shot,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Detection,Keypoints,Ocr,Vlm,Classification,Zero-shot,Plugin>

<div class="card tutorials-card" link=models/openbmb_MiniCPM_V_4_5.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>openbmb/MiniCPM-V-4_5</strong>
</div>

<p class="card-summary">MiniCPM-V 4.5 is the latest and most capable model in the MiniCPM-V series. The model is built on Qwen3-8B and SigLIP2-400M with a total of 8B parameters.</p>

<p class="tags">Detection,Keypoints,Ocr,Vlm,Classification,Zero-shot,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Detection,Segmentation,Ocr,Vlm,Zero-shot,Plugin>

<div class="card tutorials-card" link=models/vikhyatk_moondream2.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>vikhyatk/moondream2</strong>
</div>

<p class="card-summary">Moondream is a small vision language model designed to run efficiently on edge devices.</p>

<p class="tags">Detection,Segmentation,Ocr,Vlm,Zero-shot,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Detection,Segmentation,Ocr,Vlm,Zero-shot,Plugin>

<div class="card tutorials-card" link=models/microsoft_Florence_2_base.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>microsoft/Florence-2-base</strong>
</div>

<p class="card-summary">Florence-2 is a vision foundation model with a unified, prompt-based representation for a variety of computer vision and vision-language tasks (https\\://arxiv.org/abs/2311.06242).</p>

<p class="tags">Detection,Segmentation,Ocr,Vlm,Zero-shot,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Detection,Segmentation,Ocr,Vlm,Zero-shot,Plugin>

<div class="card tutorials-card" link=models/microsoft_Florence_2_large.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>microsoft/Florence-2-large</strong>
</div>

<p class="card-summary">Florence-2 is a vision foundation model with a unified, prompt-based representation for a variety of computer vision and vision-language tasks (https\\://arxiv.org/abs/2311.06242).</p>

<p class="tags">Detection,Segmentation,Ocr,Vlm,Zero-shot,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Detection,Segmentation,Ocr,Vlm,Zero-shot,Plugin>

<div class="card tutorials-card" link=models/microsoft_Florence_2_base_ft.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>microsoft/Florence-2-base-ft</strong>
</div>

<p class="card-summary">Florence-2 is a vision foundation model with a unified, prompt-based representation for a variety of computer vision and vision-language tasks (https\\://arxiv.org/abs/2311.06242).</p>

<p class="tags">Detection,Segmentation,Ocr,Vlm,Zero-shot,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Detection,Segmentation,Ocr,Vlm,Zero-shot,Plugin>

<div class="card tutorials-card" link=models/microsoft_Florence_2_large_ft.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>microsoft/Florence-2-large-ft</strong>
</div>

<p class="card-summary">Florence-2 is a vision foundation model with a unified, prompt-based representation for a variety of computer vision and vision-language tasks (https\\://arxiv.org/abs/2311.06242).</p>

<p class="tags">Detection,Segmentation,Ocr,Vlm,Zero-shot,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Detection,Ocr,Vlm,Classification,Zero-shot,Visual-agent,Plugin>

<div class="card tutorials-card" link=models/showlab_ShowUI_2B.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>showlab/ShowUI-2B</strong>
</div>

<p class="card-summary">ShowUI is a lightweight (2B) vision-language-action model designed for GUI agents.</p>

<p class="tags">Detection,Ocr,Vlm,Classification,Zero-shot,Visual-agent,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Detection,Ocr,Vlm,Classification,Zero-shot,Visual-agent,Plugin>

<div class="card tutorials-card" link=models/XiaomiMiMo_MiMo_VL_7B_RL.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>XiaomiMiMo/MiMo-VL-7B-RL</strong>
</div>

<p class="card-summary">MiMo-VL-7B is a compact yet powerful vision-language model developed through extensive pre-training and reinforcement learning to achieve state-of-the-art performance on a variety of visual-language tasks.</p>

<p class="tags">Detection,Ocr,Vlm,Classification,Zero-shot,Visual-agent,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Detection,Ocr,Vlm,Classification,Zero-shot,Visual-agent,Plugin>

<div class="card tutorials-card" link=models/XiaomiMiMo_MiMo_VL_7B_SFT.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>XiaomiMiMo/MiMo-VL-7B-SFT</strong>
</div>

<p class="card-summary">MiMo-VL-7B is a compact yet powerful vision-language model developed through extensive pre-training and reinforcement learning to achieve state-of-the-art performance on a variety of visual-language tasks.</p>

<p class="tags">Detection,Ocr,Vlm,Classification,Zero-shot,Visual-agent,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Detection,Ocr,Vlm,Classification,Zero-shot,Visual-agent,Plugin>

<div class="card tutorials-card" link=models/XiaomiMiMo_MiMo_VL_7B_SFT_GGUF.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>XiaomiMiMo/MiMo-VL-7B-SFT-GGUF</strong>
</div>

<p class="card-summary">MiMo-VL-7B is a compact yet powerful vision-language model developed through extensive pre-training and reinforcement learning to achieve state-of-the-art performance on a variety of visual-language tasks.</p>

<p class="tags">Detection,Ocr,Vlm,Classification,Zero-shot,Visual-agent,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Detection,Ocr,Vlm,Classification,Zero-shot,Visual-agent,Plugin>

<div class="card tutorials-card" link=models/OS_Copilot_OS_Atlas_Base_7B.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>OS-Copilot/OS-Atlas-Base-7B</strong>
</div>

<p class="card-summary">OS-Atlas provides a series of models specifically designed for GUI agents.</p>

<p class="tags">Detection,Ocr,Vlm,Classification,Zero-shot,Visual-agent,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Detection,Ocr,Vlm,Classification,Zero-shot,Plugin>

<div class="card tutorials-card" link=models/Qwen_Qwen2_5_VL_3B_Instruct.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>Qwen/Qwen2.5-VL-3B-Instruct</strong>
</div>

<p class="card-summary">Qwen2.5-VL is the multimodal large language model series developed by Qwen team, Alibaba Cloud.</p>

<p class="tags">Detection,Ocr,Vlm,Classification,Zero-shot,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Detection,Segmentation,Ocr,Vlm,Zero-shot,Plugin>

<div class="card tutorials-card" link=models/Qwen_Qwen2_5_VL_3B_Instruct_AWQ.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>Qwen/Qwen2.5-VL-3B-Instruct-AWQ</strong>
</div>

<p class="card-summary">Qwen2.5-VL is the multimodal large language model series developed by Qwen team, Alibaba Cloud.</p>

<p class="tags">Detection,Segmentation,Ocr,Vlm,Zero-shot,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Detection,Segmentation,Ocr,Vlm,Zero-shot,Plugin>

<div class="card tutorials-card" link=models/Qwen_Qwen2_5_VL_7B_Instruct.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>Qwen/Qwen2.5-VL-7B-Instruct</strong>
</div>

<p class="card-summary">Qwen2.5-VL is the multimodal large language model series developed by Qwen team, Alibaba Cloud.</p>

<p class="tags">Detection,Segmentation,Ocr,Vlm,Zero-shot,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Detection,Segmentation,Ocr,Vlm,Zero-shot,Plugin>

<div class="card tutorials-card" link=models/Qwen_Qwen2_5_VL_7B_Instruct_AWQ.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>Qwen/Qwen2.5-VL-7B-Instruct-AWQ</strong>
</div>

<p class="card-summary">Qwen2.5-VL is the multimodal large language model series developed by Qwen team, Alibaba Cloud.</p>

<p class="tags">Detection,Segmentation,Ocr,Vlm,Zero-shot,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Detection,Segmentation,Ocr,Vlm,Zero-shot,Plugin>

<div class="card tutorials-card" link=models/Qwen_Qwen2_5_VL_32B_Instruct.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>Qwen/Qwen2.5-VL-32B-Instruct</strong>
</div>

<p class="card-summary">Qwen2.5-VL is the multimodal large language model series developed by Qwen team, Alibaba Cloud.</p>

<p class="tags">Detection,Segmentation,Ocr,Vlm,Zero-shot,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Detection,Segmentation,Ocr,Vlm,Zero-shot,Plugin>

<div class="card tutorials-card" link=models/Qwen_Qwen2_5_VL_32B_Instruct_AWQ.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>Qwen/Qwen2.5-VL-32B-Instruct-AWQ</strong>
</div>

<p class="card-summary">Qwen2.5-VL is the multimodal large language model series developed by Qwen team, Alibaba Cloud.</p>

<p class="tags">Detection,Segmentation,Ocr,Vlm,Zero-shot,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Detection,Segmentation,Ocr,Vlm,Zero-shot,Plugin>

<div class="card tutorials-card" link=models/Qwen_Qwen2_5_VL_72B_Instruct.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>Qwen/Qwen2.5-VL-72B-Instruct</strong>
</div>

<p class="card-summary">Qwen2.5-VL is the multimodal large language model series developed by Qwen team, Alibaba Cloud.</p>

<p class="tags">Detection,Segmentation,Ocr,Vlm,Zero-shot,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Detection,Segmentation,Ocr,Vlm,Zero-shot,Plugin>

<div class="card tutorials-card" link=models/Qwen_Qwen2_5_VL_72B_Instruct_AWQ.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>Qwen/Qwen2.5-VL-72B-Instruct-AWQ</strong>
</div>

<p class="card-summary">Qwen2.5-VL is the multimodal large language model series developed by Qwen team, Alibaba Cloud.</p>

<p class="tags">Detection,Segmentation,Ocr,Vlm,Zero-shot,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Embeddings,Ocr,Vlm,Document-retrieval,Plugin>

<div class="card tutorials-card" link=models/llamaindex_vdr_2b_v1.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>llamaindex/vdr-2b-v1</strong>
</div>

<p class="card-summary">vdr-2b-v1 is an english only embedding model designed for visual document retrieval. It encodes document page screenshots into dense single-vector representations, this will effectively allow to search and query visually rich multilingual documents without the need for any OCR, data extraction pipelines, and chunking.</p>

<p class="tags">Embeddings,Ocr,Vlm,Document-retrieval,Plugin</p>

</div>

</div>

</div>

</div>

<div class="col-md-6 tutorials-card-container" data-tags=Embeddings,Ocr,Vlm,Document-retrieval,Plugin>

<div class="card tutorials-card" link=models/llamaindex_vdr_2b_multi_v1.html>

<div class="card-body">



<div class="tutorials-card-content">

<div class="card-title-container">
    <strong>llamaindex/vdr-2b-multi-v1</strong>
</div>

<p class="card-summary">vdr-2b-multi-v1 is a multilingual embedding model designed for visual document retrieval across multiple languages and domains. It encodes document page screenshots into dense single-vector representations, this will effectively allow to search and query visually rich multilingual documents without the need for any OCR, data extraction pipelines, and chunking. It's trained on 🇮🇹 Italian, 🇪🇸 Spanish, 🇬🇧 English, 🇫🇷 French and 🇩🇪 German</p>

<p class="tags">Embeddings,Ocr,Vlm,Document-retrieval,Plugin</p>

</div>

</div>

</div>

</div>
