BiTAgent: A Task-Aware Modular Framework for Bidirectional Coupling between Multimodal Large Language Models and World Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhan, Yu-Wei, Wang, Xin, Mao, Pengzhe, Feng, Tongtong, Wang, Ren, Zhu, Wenwu |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
EvolvingAgent: Curriculum Self-evolving Agent with Continual World Model for Long-Horizon Tasks
par: Feng, Tongtong, et autres
Publié: (2025)
par: Feng, Tongtong, et autres
Publié: (2025)
Embodied AI: From LLMs to World Models
par: Feng, Tongtong, et autres
Publié: (2025)
par: Feng, Tongtong, et autres
Publié: (2025)
Self-evolving Embodied AI
par: Feng, Tongtong, et autres
Publié: (2026)
par: Feng, Tongtong, et autres
Publié: (2026)
PhyVLLM: Physics-Guided Video Language Model with Motion-Appearance Disentanglement
par: Zhan, Yu-Wei, et autres
Publié: (2025)
par: Zhan, Yu-Wei, et autres
Publié: (2025)
Modular Machine Learning: An Indispensable Path towards New-Generation Large Language Models
par: Wang, Xin, et autres
Publié: (2025)
par: Wang, Xin, et autres
Publié: (2025)
U2UData+: A Scalable Swarm UAVs Autonomous Flight Dataset for Embodied Long-horizon Tasks
par: Feng, Tongtong, et autres
Publié: (2025)
par: Feng, Tongtong, et autres
Publié: (2025)
Towards Multimodal Graph Large Language Model
par: Wang, Xin, et autres
Publié: (2025)
par: Wang, Xin, et autres
Publié: (2025)
U2UData: A Large-scale Cooperative Perception Dataset for Swarm UAVs Autonomous Flight
par: Feng, Tongtong, et autres
Publié: (2024)
par: Feng, Tongtong, et autres
Publié: (2024)
Multi-weather Cross-view Geo-localization Using Denoising Diffusion Models
par: Feng, Tongtong, et autres
Publié: (2024)
par: Feng, Tongtong, et autres
Publié: (2024)
A Unified Graph Language Model for Multi-Domain Multi-Task Graph Alignment Instruction Tuning
par: Chen, Haibo, et autres
Publié: (2026)
par: Chen, Haibo, et autres
Publié: (2026)
AuTAgent: A Reinforcement Learning Framework for Tool-Augmented Audio Reasoning
par: Tong, Siqian, et autres
Publié: (2026)
par: Tong, Siqian, et autres
Publié: (2026)
Disentangled Representation Learning with Large Language Models for Text-Attributed Graphs
par: Qin, Yijian, et autres
Publié: (2023)
par: Qin, Yijian, et autres
Publié: (2023)
BiSup: Bidirectional Quantization Error Suppression for Large Language Models
par: Zou, Minghui, et autres
Publié: (2024)
par: Zou, Minghui, et autres
Publié: (2024)
OOD-GraphLLM: Graph Large Language Model for Out-of-Distribution Generalized Drug Synergy Prediction
par: Wang, Xin, et autres
Publié: (2026)
par: Wang, Xin, et autres
Publié: (2026)
KG-BiLM: Knowledge Graph Embedding via Bidirectional Language Models
par: Chen, Zirui, et autres
Publié: (2025)
par: Chen, Zirui, et autres
Publié: (2025)
Griffon-G: Bridging Vision-Language and Vision-Centric Tasks via Large Multimodal Models
par: Zhan, Yufei, et autres
Publié: (2024)
par: Zhan, Yufei, et autres
Publié: (2024)
Interpretable Bilingual Multimodal Large Language Model for Diverse Biomedical Tasks
par: Wang, Lehan, et autres
Publié: (2024)
par: Wang, Lehan, et autres
Publié: (2024)
Bi-Coupling Method and Applications
par: Ren, Panpan, et autres
Publié: (2023)
par: Ren, Panpan, et autres
Publié: (2023)
Resurfacing Paralinguistic Awareness in Large Audio Language Models
par: Yang, Hao, et autres
Publié: (2026)
par: Yang, Hao, et autres
Publié: (2026)
Bi-Erasing: A Bidirectional Framework for Concept Removal in Diffusion Models
par: Chen, Hao, et autres
Publié: (2025)
par: Chen, Hao, et autres
Publié: (2025)
Bi-Chainer: Automated Large Language Models Reasoning with Bidirectional Chaining
par: Liu, Shuqi, et autres
Publié: (2024)
par: Liu, Shuqi, et autres
Publié: (2024)
WorldVQA: Measuring Atomic World Knowledge in Multimodal Large Language Models
par: Zhou, Runjie, et autres
Publié: (2026)
par: Zhou, Runjie, et autres
Publié: (2026)
LatticeWorld: A Multimodal Large Language Model-Empowered Framework for Interactive Complex World Generation
par: Duan, Yinglin, et autres
Publié: (2025)
par: Duan, Yinglin, et autres
Publié: (2025)
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment
par: Yan, Ziang, et autres
Publié: (2024)
par: Yan, Ziang, et autres
Publié: (2024)
AV-Unified: A Unified Framework for Audio-visual Scene Understanding
par: Li, Guangyao, et autres
Publié: (2026)
par: Li, Guangyao, et autres
Publié: (2026)
Mixture-of-World Models: Scaling Multi-Task Reinforcement Learning with Modular Latent Dynamics
par: Zhang, Boxuan, et autres
Publié: (2026)
par: Zhang, Boxuan, et autres
Publié: (2026)
LLM4DyG: Can Large Language Models Solve Spatial-Temporal Problems on Dynamic Graphs?
par: Zhang, Zeyang, et autres
Publié: (2023)
par: Zhang, Zeyang, et autres
Publié: (2023)
SMAR: Soft Modality-Aware Routing Strategy for MoE-based Multimodal Large Language Models Preserving Language Capabilities
par: Xia, Guoyang, et autres
Publié: (2025)
par: Xia, Guoyang, et autres
Publié: (2025)
MM-InstructEval: Zero-Shot Evaluation of (Multimodal) Large Language Models on Multimodal Reasoning Tasks
par: Yang, Xiaocui, et autres
Publié: (2024)
par: Yang, Xiaocui, et autres
Publié: (2024)
mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality
par: Ye, Qinghao, et autres
Publié: (2023)
par: Ye, Qinghao, et autres
Publié: (2023)
Uncertainty-Aware Exploratory Direct Preference Optimization for Multimodal Large Language Models
par: Zhang, Huatian, et autres
Publié: (2026)
par: Zhang, Huatian, et autres
Publié: (2026)
LLM4VG: Large Language Models Evaluation for Video Grounding
par: Feng, Wei, et autres
Publié: (2023)
par: Feng, Wei, et autres
Publié: (2023)
Decoupled Similarity for Task-Aware Token Pruning in Large Vision-Language Models
par: Ma, Kexin, et autres
Publié: (2026)
par: Ma, Kexin, et autres
Publié: (2026)
A Comprehensive Survey and Guide to Multimodal Large Language Models in Vision-Language Tasks
par: Liang, Chia Xin, et autres
Publié: (2024)
par: Liang, Chia Xin, et autres
Publié: (2024)
Exploring the Potential of Large Language Models in Graph Generation
par: Yao, Yang, et autres
Publié: (2024)
par: Yao, Yang, et autres
Publié: (2024)
Modular-Cam: Modular Dynamic Camera-view Video Generation with LLM
par: Pan, Zirui, et autres
Publié: (2025)
par: Pan, Zirui, et autres
Publié: (2025)
Sample then Identify: A General Framework for Risk Control and Assessment in Multimodal Large Language Models
par: Wang, Qingni, et autres
Publié: (2024)
par: Wang, Qingni, et autres
Publié: (2024)
Socially-Aware Robot Navigation Enhanced by Bidirectional Natural Language Conversations Using Large Language Models
par: Wen, Congcong, et autres
Publié: (2024)
par: Wen, Congcong, et autres
Publié: (2024)
BiVRec: Bidirectional View-based Multimodal Sequential Recommendation
par: Hu, Jiaxi, et autres
Publié: (2024)
par: Hu, Jiaxi, et autres
Publié: (2024)
Grounding Everything in Tokens for Multimodal Large Language Models
par: Ren, Xiangxuan, et autres
Publié: (2025)
par: Ren, Xiangxuan, et autres
Publié: (2025)
Documents similaires
-
EvolvingAgent: Curriculum Self-evolving Agent with Continual World Model for Long-Horizon Tasks
par: Feng, Tongtong, et autres
Publié: (2025) -
Embodied AI: From LLMs to World Models
par: Feng, Tongtong, et autres
Publié: (2025) -
Self-evolving Embodied AI
par: Feng, Tongtong, et autres
Publié: (2026) -
PhyVLLM: Physics-Guided Video Language Model with Motion-Appearance Disentanglement
par: Zhan, Yu-Wei, et autres
Publié: (2025) -
Modular Machine Learning: An Indispensable Path towards New-Generation Large Language Models
par: Wang, Xin, et autres
Publié: (2025)