On Path to Multimodal Generalist: General-Level and General-Bench
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Fei, Hao, Zhou, Yuan, Li, Juncheng, Li, Xiangtai, Xu, Qingshan, Li, Bobo, Wu, Shengqiong, Wang, Yaoting, Zhou, Junbao, Meng, Jiahao, Shi, Qingyu, Zhou, Zhiyuan, Shi, Liangtao, Gao, Minghe, Zhang, Daoan, Ge, Zhiqi, Wu, Weiming, Tang, Siliang, Pan, Kaihang, Ye, Yaobo, Yuan, Haobo, Zhang, Tao, Ju, Tianjie, Meng, Zixiang, Xu, Shilin, Jia, Liyu, Hu, Wentao, Luo, Meng, Luo, Jiebo, Chua, Tat-Seng, Yan, Shuicheng, Zhang, Hanwang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
UniVA: Universal Video Agent towards Open-Source Next-Generation Video Generalist
par: Liang, Zhengyang, et autres
Publié: (2025)
par: Liang, Zhengyang, et autres
Publié: (2025)
Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey
par: Wang, Yaoting, et autres
Publié: (2025)
par: Wang, Yaoting, et autres
Publié: (2025)
CARE Transformer: Mobile-Friendly Linear Visual Transformer via Decoupled Dual Interaction
par: Zhou, Yuan, et autres
Publié: (2024)
par: Zhou, Yuan, et autres
Publié: (2024)
Streaming Drag-Oriented Interactive Video Manipulation: Drag Anything, Anytime!
par: Zhou, Junbao, et autres
Publié: (2025)
par: Zhou, Junbao, et autres
Publié: (2025)
NUS-Emo at SemEval-2024 Task 3: Instruction-Tuning LLM for Multimodal Emotion-Cause Analysis in Conversations
par: Luo, Meng, et autres
Publié: (2024)
par: Luo, Meng, et autres
Publié: (2024)
Towards Semantic Equivalence of Tokenization in Multimodal LLM
par: Wu, Shengqiong, et autres
Publié: (2024)
par: Wu, Shengqiong, et autres
Publié: (2024)
Generative Multimodal Pretraining with Discrete Diffusion Timestep Tokens
par: Pan, Kaihang, et autres
Publié: (2025)
par: Pan, Kaihang, et autres
Publié: (2025)
Vitron: A Unified Pixel-level Vision LLM for Understanding, Generating, Segmenting, Editing
par: Fei, Hao, et autres
Publié: (2024)
par: Fei, Hao, et autres
Publié: (2024)
Synergizing Understanding and Generation with Interleaved Analyzing-Drafting Thinking
par: Wu, Shengqiong, et autres
Publié: (2026)
par: Wu, Shengqiong, et autres
Publié: (2026)
DragNeXt: Rethinking Drag-Based Image Editing
par: Zhou, Yuan, et autres
Publié: (2025)
par: Zhou, Yuan, et autres
Publié: (2025)
DGMamba: Domain Generalization via Generalized State Space Model
par: Long, Shaocong, et autres
Publié: (2024)
par: Long, Shaocong, et autres
Publié: (2024)
Learning 4D Panoptic Scene Graph Generation from Rich 2D Visual Scene
par: Wu, Shengqiong, et autres
Publié: (2025)
par: Wu, Shengqiong, et autres
Publié: (2025)
Real-Time Motion-Controllable Autoregressive Video Diffusion
par: Zhao, Kesen, et autres
Publié: (2025)
par: Zhao, Kesen, et autres
Publié: (2025)
NeuSpring: Neural Spring Fields for Reconstruction and Simulation of Deformable Objects from Videos
par: Xu, Qingshan, et autres
Publié: (2025)
par: Xu, Qingshan, et autres
Publié: (2025)
A Versatile Multimodal Agent for Multimedia Content Generation
par: Zhang, Daoan, et autres
Publié: (2026)
par: Zhang, Daoan, et autres
Publié: (2026)
Auto-Encoding Morph-Tokens for Multimodal LLM
par: Pan, Kaihang, et autres
Publié: (2024)
par: Pan, Kaihang, et autres
Publié: (2024)
OMG-LLaVA: Bridging Image-level, Object-level, Pixel-level Reasoning and Understanding
par: Zhang, Tao, et autres
Publié: (2024)
par: Zhang, Tao, et autres
Publié: (2024)
Fine-tuning Multimodal LLMs to Follow Zero-shot Demonstrative Instructions
par: Li, Juncheng, et autres
Publié: (2023)
par: Li, Juncheng, et autres
Publié: (2023)
DVIS-DAQ: Improving Video Segmentation via Dynamic Anchor Queries
par: Zhou, Yikang, et autres
Publié: (2024)
par: Zhou, Yikang, et autres
Publié: (2024)
HumanEdit: A High-Quality Human-Rewarded Dataset for Instruction-based Image Editing
par: Bai, Jinbin, et autres
Publié: (2024)
par: Bai, Jinbin, et autres
Publié: (2024)
MVGamba: Unify 3D Content Generation as State Space Sequence Modeling
par: Yi, Xuanyu, et autres
Publié: (2024)
par: Yi, Xuanyu, et autres
Publié: (2024)
VistaDPO: Video Hierarchical Spatial-Temporal Direct Preference Optimization for Large Video Models
par: Huang, Haojian, et autres
Publié: (2025)
par: Huang, Haojian, et autres
Publié: (2025)
The Docking Game: Loop Self-Play for Fast, Dynamic, and Accurate Prediction of Flexible Protein-Ligand Binding
par: Zhang, Youzhi, et autres
Publié: (2025)
par: Zhang, Youzhi, et autres
Publié: (2025)
MuSteerNet: Human Reaction Generation from Videos via Observation-Reaction Mutual Steering
par: Zhou, Yuan, et autres
Publié: (2026)
par: Zhou, Yuan, et autres
Publié: (2026)
Personalize Your Gaussian: Consistent 3D Scene Personalization from a Single Image
par: Wang, Yuxuan, et autres
Publié: (2025)
par: Wang, Yuxuan, et autres
Publié: (2025)
Global Commander and Local Operative: A Dual-Agent Framework for Scene Navigation
par: Jin, Kaiming, et autres
Publié: (2026)
par: Jin, Kaiming, et autres
Publié: (2026)
WEAVE: Unleashing and Benchmarking the In-context Interleaved Comprehension and Generation
par: Chow, Wei, et autres
Publié: (2025)
par: Chow, Wei, et autres
Publié: (2025)
VisualActBench: Can VLMs See and Act like a Human?
par: Zhang, Daoan, et autres
Publié: (2025)
par: Zhang, Daoan, et autres
Publié: (2025)
Generative Classifier for Domain Generalization
par: Long, Shaocong, et autres
Publié: (2025)
par: Long, Shaocong, et autres
Publié: (2025)
CoCoT: Contrastive Chain-of-Thought Prompting for Large Multimodal Models with Multiple Image Inputs
par: Zhang, Daoan, et autres
Publié: (2024)
par: Zhang, Daoan, et autres
Publié: (2024)
Point Cloud Mamba: Point Cloud Learning via State Space Model
par: Zhang, Tao, et autres
Publié: (2024)
par: Zhang, Tao, et autres
Publié: (2024)
Sphinx: Benchmarking and Modeling for LLM-Driven Pull Request Review
par: Zhang, Daoan, et autres
Publié: (2026)
par: Zhang, Daoan, et autres
Publié: (2026)
Unified Generative and Discriminative Training for Multi-modal Large Language Models
par: Chow, Wei, et autres
Publié: (2024)
par: Chow, Wei, et autres
Publié: (2024)
Diffusion Time-step Curriculum for One Image to 3D Generation
par: Yi, Xuanyu, et autres
Publié: (2024)
par: Yi, Xuanyu, et autres
Publié: (2024)
Identity-Preserving Text-to-Video Generation by Frequency Decomposition
par: Yuan, Shenghai, et autres
Publié: (2024)
par: Yuan, Shenghai, et autres
Publié: (2024)
Learning Brain Tumor Representation in 3D High-Resolution MR Images via Interpretable State Space Models
par: Hu, Qingqiao, et autres
Publié: (2024)
par: Hu, Qingqiao, et autres
Publié: (2024)
PanoSent: A Panoptic Sextuple Extraction Benchmark for Multimodal Conversational Aspect-based Sentiment Analysis
par: Luo, Meng, et autres
Publié: (2024)
par: Luo, Meng, et autres
Publié: (2024)
Reasoning Physical Video Generation with Diffusion Timestep Tokens via Reinforcement Learning
par: Lin, Wang, et autres
Publié: (2025)
par: Lin, Wang, et autres
Publié: (2025)
WorldGenBench: A World-Knowledge-Integrated Benchmark for Reasoning-Driven Text-to-Image Generation
par: Zhang, Daoan, et autres
Publié: (2025)
par: Zhang, Daoan, et autres
Publié: (2025)
Consistent3D: Towards Consistent High-Fidelity Text-to-3D Generation with Deterministic Sampling Prior
par: Wu, Zike, et autres
Publié: (2024)
par: Wu, Zike, et autres
Publié: (2024)
Documents similaires
-
UniVA: Universal Video Agent towards Open-Source Next-Generation Video Generalist
par: Liang, Zhengyang, et autres
Publié: (2025) -
Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey
par: Wang, Yaoting, et autres
Publié: (2025) -
CARE Transformer: Mobile-Friendly Linear Visual Transformer via Decoupled Dual Interaction
par: Zhou, Yuan, et autres
Publié: (2024) -
Streaming Drag-Oriented Interactive Video Manipulation: Drag Anything, Anytime!
par: Zhou, Junbao, et autres
Publié: (2025) -
NUS-Emo at SemEval-2024 Task 3: Instruction-Tuning LLM for Multimodal Emotion-Cause Analysis in Conversations
par: Luo, Meng, et autres
Publié: (2024)