Enregistré dans:
| Auteurs principaux: | Zhu, Minjie, Zhu, Yichen, Liu, Xin, Liu, Ning, Xu, Zhiyuan, Shen, Chaomin, Peng, Yaxin, Ou, Zhicai, Feng, Feifei, Tang, Jian |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2403.06199 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LLaVA-Phi: Efficient Multi-Modal Assistant with Small Language Model
par: Zhu, Yichen, et autres
Publié: (2024)
par: Zhu, Yichen, et autres
Publié: (2024)
ChatVLA: Unified Multimodal Understanding and Robot Control with Vision-Language-Action Model
par: Zhou, Zhongyi, et autres
Publié: (2025)
par: Zhou, Zhongyi, et autres
Publié: (2025)
Language-Conditioned Robotic Manipulation with Fast and Slow Thinking
par: Zhu, Minjie, et autres
Publié: (2024)
par: Zhu, Minjie, et autres
Publié: (2024)
MMRo: Are Multimodal LLMs Eligible as the Brain for In-Home Robotics?
par: Li, Jinming, et autres
Publié: (2024)
par: Li, Jinming, et autres
Publié: (2024)
TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation
par: Wen, Junjie, et autres
Publié: (2024)
par: Wen, Junjie, et autres
Publié: (2024)
Object-Centric Instruction Augmentation for Robotic Manipulation
par: Wen, Junjie, et autres
Publié: (2024)
par: Wen, Junjie, et autres
Publié: (2024)
ObjectVLA: End-to-End Open-World Object Manipulation Without Demonstration
par: Zhu, Minjie, et autres
Publié: (2025)
par: Zhu, Minjie, et autres
Publié: (2025)
Diffusion-VLA: Generalizable and Interpretable Robot Foundation Model via Self-Generated Reasoning
par: Wen, Junjie, et autres
Publié: (2024)
par: Wen, Junjie, et autres
Publié: (2024)
Fresh-CL: Feature Realignment through Experts on Hypersphere in Continual Learning
par: Zhou, Zhongyi, et autres
Publié: (2025)
par: Zhou, Zhongyi, et autres
Publié: (2025)
Scaling Diffusion Policy in Transformer to 1 Billion Parameters for Robotic Manipulation
par: Zhu, Minjie, et autres
Publié: (2024)
par: Zhu, Minjie, et autres
Publié: (2024)
DexVLA: Vision-Language Model with Plug-In Diffusion Expert for General Robot Control
par: Wen, Junjie, et autres
Publié: (2025)
par: Wen, Junjie, et autres
Publié: (2025)
EDT: An Efficient Diffusion Transformer Framework Inspired by Human-like Sketching
par: Chen, Xinwang, et autres
Publié: (2024)
par: Chen, Xinwang, et autres
Publié: (2024)
Efficient Feature Fusion for UAV Object Detection
par: Wang, Xudong, et autres
Publié: (2025)
par: Wang, Xudong, et autres
Publié: (2025)
PointVLA: Injecting the 3D World into Vision-Language-Action Models
par: Li, Chengmeng, et autres
Publié: (2025)
par: Li, Chengmeng, et autres
Publié: (2025)
Visual Robotic Manipulation with Depth-Aware Pretraining
par: Wang, Wanying, et autres
Publié: (2024)
par: Wang, Wanying, et autres
Publié: (2024)
dVLA: Diffusion Vision-Language-Action Model with Multimodal Chain-of-Thought
par: Wen, Junjie, et autres
Publié: (2025)
par: Wen, Junjie, et autres
Publié: (2025)
ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge
par: Zhou, Zhongyi, et autres
Publié: (2025)
par: Zhou, Zhongyi, et autres
Publié: (2025)
Retrieval-Augmented Embodied Agents
par: Zhu, Yichen, et autres
Publié: (2024)
par: Zhu, Yichen, et autres
Publié: (2024)
WorldEval: World Model as Real-World Robot Policies Evaluator
par: Li, Yaxuan, et autres
Publié: (2025)
par: Li, Yaxuan, et autres
Publié: (2025)
Safety of Multimodal Large Language Models on Images and Texts
par: Liu, Xin, et autres
Publié: (2024)
par: Liu, Xin, et autres
Publié: (2024)
CoA-VLA: Improving Vision-Language-Action Models via Visual-Textual Chain-of-Affordance
par: Li, Jinming, et autres
Publié: (2024)
par: Li, Jinming, et autres
Publié: (2024)
Res-Bench: Benchmarking the Robustness of Multimodal Large Language Models to Dynamic Resolution Input
par: Li, Chenxu, et autres
Publié: (2025)
par: Li, Chenxu, et autres
Publié: (2025)
Look Carefully: Adaptive Visual Reinforcements in Multimodal Large Language Models for Hallucination Mitigation
par: Zhu, Xingyu, et autres
Publié: (2026)
par: Zhu, Xingyu, et autres
Publié: (2026)
MM-SafetyBench: A Benchmark for Safety Evaluation of Multimodal Large Language Models
par: Liu, Xin, et autres
Publié: (2023)
par: Liu, Xin, et autres
Publié: (2023)
Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents
par: Luo, Yaxin, et autres
Publié: (2025)
par: Luo, Yaxin, et autres
Publié: (2025)
Dynamic Multimodal Prototype Learning in Vision-Language Models
par: Zhu, Xingyu, et autres
Publié: (2025)
par: Zhu, Xingyu, et autres
Publié: (2025)
Student-Oriented Teacher Knowledge Refinement for Knowledge Distillation
par: Shen, Chaomin, et autres
Publié: (2024)
par: Shen, Chaomin, et autres
Publié: (2024)
ERGeoBench:A Comprehensive Benchmark for Embodied Reasoning and Geo-localization in Multimodal Large Language Models
par: Xue, Kaiwen, et autres
Publié: (2026)
par: Xue, Kaiwen, et autres
Publié: (2026)
CFBenchmark-MM: Chinese Financial Assistant Benchmark for Multimodal Large Language Model
par: Li, Jiangtong, et autres
Publié: (2025)
par: Li, Jiangtong, et autres
Publié: (2025)
Face-Human-Bench: A Comprehensive Benchmark of Face and Human Understanding for Multi-modal Assistants
par: Qin, Lixiong, et autres
Publié: (2025)
par: Qin, Lixiong, et autres
Publié: (2025)
Language-Pretraining-Induced Bias: A Strong Foundation for General Vision Tasks
par: Luo, Yaxin, et autres
Publié: (2026)
par: Luo, Yaxin, et autres
Publié: (2026)
A Comprehensive Survey of Large Language Models and Multimodal Large Language Models in Medicine
par: Xiao, Hanguang, et autres
Publié: (2024)
par: Xiao, Hanguang, et autres
Publié: (2024)
DocRetriever: A Plug-and-Play Framework for Multimodal Document Retrieval with Comprehensive Benchmark
par: Hu, Ruofan, et autres
Publié: (2026)
par: Hu, Ruofan, et autres
Publié: (2026)
Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models
par: Jiang, Jiachen, et autres
Publié: (2025)
par: Jiang, Jiachen, et autres
Publié: (2025)
Distilling Mathematical Reasoning Capabilities into Small Language Models
par: Zhu, Xunyu, et autres
Publié: (2024)
par: Zhu, Xunyu, et autres
Publié: (2024)
Language-Instructed Reasoning for Group Activity Detection via Multimodal Large Language Model
par: Peng, Jihua, et autres
Publié: (2025)
par: Peng, Jihua, et autres
Publié: (2025)
Mitigating Hallucinations in Large Vision-Language Models without Performance Degradation
par: Zhu, Xingyu, et autres
Publié: (2026)
par: Zhu, Xingyu, et autres
Publié: (2026)
CODIS: Benchmarking Context-Dependent Visual Comprehension for Multimodal Large Language Models
par: Luo, Fuwen, et autres
Publié: (2024)
par: Luo, Fuwen, et autres
Publié: (2024)
Towards Harmless Multimodal Assistants with Blind Preference Optimization
par: Li, Yongqi, et autres
Publié: (2025)
par: Li, Yongqi, et autres
Publié: (2025)
LLaSA: Large Language and E-Commerce Shopping Assistant
par: Zhang, Shuo, et autres
Publié: (2024)
par: Zhang, Shuo, et autres
Publié: (2024)
Documents similaires
-
LLaVA-Phi: Efficient Multi-Modal Assistant with Small Language Model
par: Zhu, Yichen, et autres
Publié: (2024) -
ChatVLA: Unified Multimodal Understanding and Robot Control with Vision-Language-Action Model
par: Zhou, Zhongyi, et autres
Publié: (2025) -
Language-Conditioned Robotic Manipulation with Fast and Slow Thinking
par: Zhu, Minjie, et autres
Publié: (2024) -
MMRo: Are Multimodal LLMs Eligible as the Brain for In-Home Robotics?
par: Li, Jinming, et autres
Publié: (2024) -
TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation
par: Wen, Junjie, et autres
Publié: (2024)