multimodal-large-language-models

17 progetti condividono questo topic GitHub

multimodal-large-language-models — star-vector ★4.5kmultimodal-large-language-modelsLLaMA-Omni — ★3.1kRPG-DiffusionMaster — ★1.8kOvis — ★1.5kVideo-MME — ★787LLaVA-Plus-Codebase — ★769OmniVinci — ★674cambrian-s — ★560EVF-SAM — ★505Spatial-MLLM — ★477Ovis-U1 — ★450Awesome-Medical-Large-Language-Models — ★393Freeze-Omni — ★388Video-MME-v2 — ★369R1-VL — ★352VisionReasoner — ★348AudioStory — ★301LLaMA-Omni★ 3.1kRPG-DiffusionMaster★ 1.8kOvis★ 1.5kVideo-MME★ 787LLaVA-Plus-Codebase★ 769OmniVinci★ 674cambrian-s★ 560EVF-SAM★ 505Spatial-MLLM★ 477Ovis-U1★ 450Awesome-Medical-Large-La…★ 393Freeze-Omni★ 388Video-MME-v2★ 369R1-VL★ 352VisionReasoner★ 348AudioStory★ 301

Le linee collegano membri che sono misurabilmente correlati tra loro. La dimensione dei punti riflette le stelle.

🧬 Membri
star-vector
StarVector is a foundation model for SVG generation that transforms vectorization into a code generation…
★ 4.5k
LLaMA-Omni
LLaMA-Omni is a low-latency and high-quality end-to-end speech interaction model built upon…
★ 3.1k
RPG-DiffusionMaster
[ICML 2024] Mastering Text-to-Image Diffusion: Recaptioning, Planning, and Generating with Multimodal LLMs…
★ 1.8k
Ovis
A novel Multimodal Large Language Model (MLLM) architecture, designed to structurally align visual and…
★ 1.5k
Video-MME
✨✨[CVPR 2025] Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video…
★ 787
LLaVA-Plus-Codebase
LLaVA-Plus: Large Language and Vision Assistants that Plug and Learn to Use Skills
★ 769
OmniVinci
OmniVinci is an omni-modal LLM for joint understanding of vision, audio, and language.
★ 674
cambrian-s
Cambrian-S: Towards Spatial Supersensing in Video
★ 560
EVF-SAM
Official code of "EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model"
★ 505
Spatial-MLLM
[NeurIPS 2025 Spotlight] Official implementation of Spatial-MLLM: Boosting MLLM Capabilities in Visual-based…
★ 477
Ovis-U1
An unified model that seamlessly integrates multimodal understanding, text-to-image generation, and image…
★ 450
Awesome-Medical-Large-Language-Models
Curated papers on Large Language Models in Healthcare and Medical domain
★ 393
Freeze-Omni
✨✨Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM
★ 388
Video-MME-v2
Video-MME-v2: Towards the Next Stage in Benchmarks for Comprehensive Video Understanding
★ 369
R1-VL
R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy…
★ 352
VisionReasoner
[ICLR 2026] VisionReasoner: Unified Reasoning-Integrated Visual Perception via Reinforcement Learning
★ 348
AudioStory
AudioStory: Generating Long-Form Narrative Audio with Large Language Models
★ 301
🔗 Famiglie affini

Misurato dai temi di GitHub condivisi da entrambi i progetti, ponderato in base a quanto è raro ciascun tema.