xGen-MM (BLIP-3): A Family of Open Large Multimodal Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xue, Le, Shu, Manli, Awadalla, Anas, Wang, Jun, Yan, An, Purushwalkam, Senthil, Zhou, Honglu, Prabhu, Viraj, Dai, Yutong, Ryoo, Michael S, Kendre, Shrikant, Zhang, Jieyu, Tseng, Shaoyen, Lujan-Moreno, Gustavo A, Olson, Matthew L, Hinck, Musashi, Cobbley, David, Lal, Vasudev, Qin, Can, Zhang, Shu, Chen, Chia-Chih, Yu, Ning, Tan, Juntao, Awalgaonkar, Tulika Manoj, Heinecke, Shelby, Wang, Huan, Choi, Yejin, Schmidt, Ludwig, Chen, Zeyuan, Savarese, Silvio, Niebles, Juan Carlos, Xiong, Caiming, Xu, Ran |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
xGen-MM-Vid (BLIP-3-Video): You Only Need 32 Tokens to Represent a Video Even in VLMs
par: Ryoo, Michael S., et autres
Publié: (2024)
par: Ryoo, Michael S., et autres
Publié: (2024)
xGen-VideoSyn-1: High-fidelity Text-to-Video Synthesis with Compressed Representations
par: Qin, Can, et autres
Publié: (2024)
par: Qin, Can, et autres
Publié: (2024)
Strefer: Empowering Video LLMs with Space-Time Referring and Reasoning via Synthetic Instruction Data
par: Zhou, Honglu, et autres
Publié: (2025)
par: Zhou, Honglu, et autres
Publié: (2025)
BLIP3-KALE: Knowledge Augmented Large-Scale Dense Captions
par: Awadalla, Anas, et autres
Publié: (2024)
par: Awadalla, Anas, et autres
Publié: (2024)
SMILE: A Composite Lexical-Semantic Metric for Question-Answering Evaluation
par: Kendre, Shrikant, et autres
Publié: (2025)
par: Kendre, Shrikant, et autres
Publié: (2025)
LLaVA-Gemma: Accelerating Multimodal Foundation Models with a Compact Language Model
par: Hinck, Musashi, et autres
Publié: (2024)
par: Hinck, Musashi, et autres
Publié: (2024)
Trust but Verify: Programmatic VLM Evaluation in the Wild
par: Prabhu, Viraj, et autres
Publié: (2024)
par: Prabhu, Viraj, et autres
Publié: (2024)
LATTE: Learning to Think with Vision Specialists
par: Ma, Zixian, et autres
Publié: (2024)
par: Ma, Zixian, et autres
Publié: (2024)
xGen-small Technical Report
par: Nijkamp, Erik, et autres
Publié: (2025)
par: Nijkamp, Erik, et autres
Publié: (2025)
Why do LLaVA Vision-Language Models Reply to Images in English?
par: Hinck, Musashi, et autres
Publié: (2024)
par: Hinck, Musashi, et autres
Publié: (2024)
DyMU: Dynamic Merging and Virtual Unmerging for Efficient VLMs
par: Wang, Zhenhailong, et autres
Publié: (2025)
par: Wang, Zhenhailong, et autres
Publié: (2025)
Robotic VLA Benefits from Joint Learning with Motion Image Diffusion
par: Fang, Yu, et autres
Publié: (2025)
par: Fang, Yu, et autres
Publié: (2025)
APIGen-MT: Agentic Pipeline for Multi-Turn Data Generation via Simulated Agent-Human Interplay
par: Prabhakar, Akshara, et autres
Publié: (2025)
par: Prabhakar, Akshara, et autres
Publié: (2025)
Causal Layering via Conditional Entropy
par: Feigenbaum, Itai, et autres
Publié: (2024)
par: Feigenbaum, Itai, et autres
Publié: (2024)
Editing Arbitrary Propositions in LLMs without Subject Labels
par: Feigenbaum, Itai, et autres
Publié: (2024)
par: Feigenbaum, Itai, et autres
Publié: (2024)
Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding
par: Wang, Ziyang, et autres
Publié: (2025)
par: Wang, Ziyang, et autres
Publié: (2025)
ActionStudio: A Lightweight Framework for Data and Training of Large Action Models
par: Zhang, Jianguo, et autres
Publié: (2025)
par: Zhang, Jianguo, et autres
Publié: (2025)
Steering Large Language Models to Evaluate and Amplify Creativity
par: Olson, Matthew Lyle, et autres
Publié: (2024)
par: Olson, Matthew Lyle, et autres
Publié: (2024)
Future Optical Flow Prediction Improves Robot Control & Video Generation
par: Ranasinghe, Kanchana, et autres
Publié: (2026)
par: Ranasinghe, Kanchana, et autres
Publié: (2026)
PersonaBench: Evaluating AI Models on Understanding Personal Information through Accessing (Synthetic) Private User Data
par: Tan, Juntao, et autres
Publié: (2025)
par: Tan, Juntao, et autres
Publié: (2025)
AgentOhana: Design Unified Data and Training Pipeline for Effective Agent Learning
par: Zhang, Jianguo, et autres
Publié: (2024)
par: Zhang, Jianguo, et autres
Publié: (2024)
ToolScan: A Benchmark for Characterizing Errors in Tool-Use LLMs
par: Kokane, Shirley, et autres
Publié: (2024)
par: Kokane, Shirley, et autres
Publié: (2024)
BLIP3o-NEXT: Next Frontier of Native Image Generation
par: Chen, Jiuhai, et autres
Publié: (2025)
par: Chen, Jiuhai, et autres
Publié: (2025)
X-InstructBLIP: A Framework for aligning X-Modal instruction-aware representations to LLMs and Emergent Cross-modal Reasoning
par: Panagopoulou, Artemis, et autres
Publié: (2023)
par: Panagopoulou, Artemis, et autres
Publié: (2023)
Debiasing Large Vision-Language Models by Ablating Protected Attribute Representations
par: Ratzlaff, Neale, et autres
Publié: (2024)
par: Ratzlaff, Neale, et autres
Publié: (2024)
ViUniT: Visual Unit Tests for More Robust Visual Programming
par: Panagopoulou, Artemis, et autres
Publié: (2024)
par: Panagopoulou, Artemis, et autres
Publié: (2024)
Probing Semantic Routing in Large Mixture-of-Expert Models
par: Olson, Matthew Lyle, et autres
Publié: (2025)
par: Olson, Matthew Lyle, et autres
Publié: (2025)
ProVision: Programmatically Scaling Vision-centric Instruction Data for Multimodal Language Models
par: Zhang, Jieyu, et autres
Publié: (2024)
par: Zhang, Jieyu, et autres
Publié: (2024)
MINT-1T: Scaling Open-Source Multimodal Data by 10x: A Multimodal Dataset with One Trillion Tokens
par: Awadalla, Anas, et autres
Publié: (2024)
par: Awadalla, Anas, et autres
Publié: (2024)
Probing the Representational Power of Sparse Autoencoders in Vision Models
par: Olson, Matthew Lyle, et autres
Publié: (2025)
par: Olson, Matthew Lyle, et autres
Publié: (2025)
Debias your Large Multi-Modal Model at Test-Time via Non-Contrastive Visual Attribute Steering
par: Ratzlaff, Neale, et autres
Publié: (2024)
par: Ratzlaff, Neale, et autres
Publié: (2024)
Analyzing Hierarchical Structure in Vision Models with Sparse Autoencoders
par: Olson, Matthew Lyle, et autres
Publié: (2025)
par: Olson, Matthew Lyle, et autres
Publié: (2025)
Entropy-Based Block Pruning for Efficient Large Language Models
par: Yang, Liangwei, et autres
Publié: (2025)
par: Yang, Liangwei, et autres
Publié: (2025)
Using Imperfect Surrogates for Downstream Inference: Design-based Supervised Learning for Social Science Applications of Large Language Models
par: Egami, Naoki, et autres
Publié: (2023)
par: Egami, Naoki, et autres
Publié: (2023)
xLAM: A Family of Large Action Models to Empower AI Agent Systems
par: Zhang, Jianguo, et autres
Publié: (2024)
par: Zhang, Jianguo, et autres
Publié: (2024)
MobileAIBench: Benchmarking LLMs and LMMs for On-Device Use Cases
par: Murthy, Rithesh, et autres
Publié: (2024)
par: Murthy, Rithesh, et autres
Publié: (2024)
LAM SIMULATOR: Advancing Data Generation for Large Action Model Training via Online Exploration and Trajectory Feedback
par: Hoang, Thai, et autres
Publié: (2025)
par: Hoang, Thai, et autres
Publié: (2025)
SFR-RAG: Towards Contextually Faithful LLMs
par: Nguyen, Xuan-Phi, et autres
Publié: (2024)
par: Nguyen, Xuan-Phi, et autres
Publié: (2024)
Hierarchical Point Attention for Indoor 3D Object Detection
par: Shu, Manli, et autres
Publié: (2023)
par: Shu, Manli, et autres
Publié: (2023)
LieCraft: A Multi-Agent Framework for Evaluating Deceptive Capabilities in Language Models
par: Olson, Matthew Lyle, et autres
Publié: (2026)
par: Olson, Matthew Lyle, et autres
Publié: (2026)
Documents similaires
-
xGen-MM-Vid (BLIP-3-Video): You Only Need 32 Tokens to Represent a Video Even in VLMs
par: Ryoo, Michael S., et autres
Publié: (2024) -
xGen-VideoSyn-1: High-fidelity Text-to-Video Synthesis with Compressed Representations
par: Qin, Can, et autres
Publié: (2024) -
Strefer: Empowering Video LLMs with Space-Time Referring and Reasoning via Synthetic Instruction Data
par: Zhou, Honglu, et autres
Publié: (2025) -
BLIP3-KALE: Knowledge Augmented Large-Scale Dense Captions
par: Awadalla, Anas, et autres
Publié: (2024) -
SMILE: A Composite Lexical-Semantic Metric for Question-Answering Evaluation
par: Kendre, Shrikant, et autres
Publié: (2025)