Merlin:Empowering Multimodal LLMs with Foresight Minds
Fuente:
arXiv
Guardado en:
| Autores principales: | Yu, En, Zhao, Liang, Wei, Yana, Yang, Jinrong, Wu, Dongming, Kong, Lingyu, Wei, Haoran, Wang, Tiancai, Ge, Zheng, Zhang, Xiangyu, Tao, Wenbing |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Unhackable Temporal Rewarding for Scalable Video MLLMs
por: Yu, En, et al.
Publicado: (2025)
por: Yu, En, et al.
Publicado: (2025)
Small Language Model Meets with Reinforced Vision Vocabulary
por: Wei, Haoran, et al.
Publicado: (2024)
por: Wei, Haoran, et al.
Publicado: (2024)
Perception-R1: Pioneering Perception Policy with Reinforcement Learning
por: Yu, En, et al.
Publicado: (2025)
por: Yu, En, et al.
Publicado: (2025)
OneChart: Purify the Chart Structural Extraction via One Auxiliary Token
por: Chen, Jinyue, et al.
Publicado: (2024)
por: Chen, Jinyue, et al.
Publicado: (2024)
Perception in Reflection
por: Wei, Yana, et al.
Publicado: (2025)
por: Wei, Yana, et al.
Publicado: (2025)
DreamLLM: Synergistic Multimodal Comprehension and Creation
por: Dong, Runpei, et al.
Publicado: (2023)
por: Dong, Runpei, et al.
Publicado: (2023)
Focus Anywhere for Fine-grained Multi-page Document Understanding
por: Liu, Chenglong, et al.
Publicado: (2024)
por: Liu, Chenglong, et al.
Publicado: (2024)
Cross-View Referring Multi-Object Tracking
por: Chen, Sijia, et al.
Publicado: (2024)
por: Chen, Sijia, et al.
Publicado: (2024)
ReaMOT: A Benchmark and Framework for Reasoning-based Multi-Object Tracking
por: Chen, Sijia, et al.
Publicado: (2025)
por: Chen, Sijia, et al.
Publicado: (2025)
PerPO: Perceptual Preference Optimization via Discriminative Rewarding
por: Zhu, Zining, et al.
Publicado: (2025)
por: Zhu, Zining, et al.
Publicado: (2025)
General OCR Theory: Towards OCR-2.0 via a Unified End-to-end Model
por: Wei, Haoran, et al.
Publicado: (2024)
por: Wei, Haoran, et al.
Publicado: (2024)
Delving into the Trajectory Long-tail Distribution for Muti-object Tracking
por: Chen, Sijia, et al.
Publicado: (2024)
por: Chen, Sijia, et al.
Publicado: (2024)
Disentangling Instance and Scene Contexts for 3D Semantic Scene Completion
por: Liu, Enyu, et al.
Publicado: (2025)
por: Liu, Enyu, et al.
Publicado: (2025)
OVTR: End-to-End Open-Vocabulary Multiple Object Tracking with Transformer
por: Li, Jinyang, et al.
Publicado: (2025)
por: Li, Jinyang, et al.
Publicado: (2025)
Foresight Diffusion: Improving Sampling Consistency in Predictive Diffusion Models
por: Zhang, Yu, et al.
Publicado: (2025)
por: Zhang, Yu, et al.
Publicado: (2025)
Reconstructive Visual Instruction Tuning
por: Wang, Haochen, et al.
Publicado: (2024)
por: Wang, Haochen, et al.
Publicado: (2024)
Thinking by Doing: Building Efficient World Model Reasoning in LLMs via Multi-turn Interaction
por: Shu, Bao, et al.
Publicado: (2025)
por: Shu, Bao, et al.
Publicado: (2025)
Language Prompt for Autonomous Driving
por: Wu, Dongming, et al.
Publicado: (2023)
por: Wu, Dongming, et al.
Publicado: (2023)
The impact of baffle and taper channel tilt angle on the output performance of proton‐exchange membrane fuel cells
por: Tiancai Cheng, et al.
Publicado: (2024)
por: Tiancai Cheng, et al.
Publicado: (2024)
ORMOT: A Dataset and Framework for Omnidirectional Referring Multi-Object Tracking
por: Chen, Sijia, et al.
Publicado: (2026)
por: Chen, Sijia, et al.
Publicado: (2026)
Merlin: Multi-View Representation Learning for Robust Multivariate Time Series Forecasting with Unfixed Missing Rates
por: Yu, Chengqing, et al.
Publicado: (2025)
por: Yu, Chengqing, et al.
Publicado: (2025)
Vision Enhancing LLMs: Empowering Multimodal Knowledge Storage and Sharing in LLMs
por: Li, Yunxin, et al.
Publicado: (2023)
por: Li, Yunxin, et al.
Publicado: (2023)
Empowering Multimodal LLMs with External Tools: A Comprehensive Survey
por: An, Wenbin, et al.
Publicado: (2025)
por: An, Wenbin, et al.
Publicado: (2025)
Is a 3D-Tokenized LLM the Key to Reliable Autonomous Driving?
por: Bai, Yifan, et al.
Publicado: (2024)
por: Bai, Yifan, et al.
Publicado: (2024)
ForgerySleuth: Empowering Multimodal Large Language Models for Image Manipulation Detection
por: Sun, Zhihao, et al.
Publicado: (2024)
por: Sun, Zhihao, et al.
Publicado: (2024)
Can Multimodal LLMs Perform Time Series Anomaly Detection?
por: Xu, Xiongxiao, et al.
Publicado: (2025)
por: Xu, Xiongxiao, et al.
Publicado: (2025)
Beyond the Cartesian Illusion: Testing Two-Stage Multi-Modal Theory of Mind under Perceptual Bottlenecks
por: Zhou, Yajing, et al.
Publicado: (2026)
por: Zhou, Yajing, et al.
Publicado: (2026)
Generative Visual Foresight Meets Task-Agnostic Pose Estimation in Robotic Table-Top Manipulation
por: Zhang, Chuye, et al.
Publicado: (2025)
por: Zhang, Chuye, et al.
Publicado: (2025)
DEGround: An Effective Baseline for Ego-centric 3D Visual Grounding with a Homogeneous Framework
por: Zhang, Yani, et al.
Publicado: (2025)
por: Zhang, Yani, et al.
Publicado: (2025)
Research on the Flexural Performance and Degree of Composite Action of Precast Concrete Sandwich Panels With Concrete Ribs
por: Qi Ge, et al.
Publicado: (2025)
por: Qi Ge, et al.
Publicado: (2025)
MindCine: Multimodal EEG-to-Video Reconstruction with Large-Scale Pretrained Models
por: Zhou, Tian-Yi, et al.
Publicado: (2026)
por: Zhou, Tian-Yi, et al.
Publicado: (2026)
Multipole expansion of the gravitational field in a general class of fourth-order theories of gravity and the application in gyroscopic precession
por: Wu, Bofeng, et al.
Publicado: (2023)
por: Wu, Bofeng, et al.
Publicado: (2023)
Edge-Cloud Collaborative Pothole Detection via Onboard Event Screening and Federated Temporal Segmentation
por: Wu, Yingjie, et al.
Publicado: (2026)
por: Wu, Yingjie, et al.
Publicado: (2026)
DRMOT: A Dataset and Framework for RGBD Referring Multi-Object Tracking
por: Chen, Sijia, et al.
Publicado: (2026)
por: Chen, Sijia, et al.
Publicado: (2026)
Lumos : Empowering Multimodal LLMs with Scene Text Recognition
por: Shenoy, Ashish, et al.
Publicado: (2024)
por: Shenoy, Ashish, et al.
Publicado: (2024)
Foresight Prediction Enhanced Live-Streaming Recommendation
por: Cao, Jiangxia, et al.
Publicado: (2025)
por: Cao, Jiangxia, et al.
Publicado: (2025)
PaperMind: Benchmarking Agentic Reasoning and Critique over Scientific Papers in Multimodal LLMs
por: Zhao, Yanjun, et al.
Publicado: (2026)
por: Zhao, Yanjun, et al.
Publicado: (2026)
TeamLLM: A Human-Like Team-Oriented Collaboration Framework for Multi-Step Contextualized Tasks
por: Wang, Xiangyu, et al.
Publicado: (2026)
por: Wang, Xiangyu, et al.
Publicado: (2026)
Quantum Merlin-Arthur with an internally separable proof
por: Bassirian, Roozbeh, et al.
Publicado: (2024)
por: Bassirian, Roozbeh, et al.
Publicado: (2024)
Adaptive Graph Refinement and Label Propagation with LLMs for Cost-Effective Entity Resolution
por: Wang, Hongtao, et al.
Publicado: (2026)
por: Wang, Hongtao, et al.
Publicado: (2026)
Ejemplares similares
-
Unhackable Temporal Rewarding for Scalable Video MLLMs
por: Yu, En, et al.
Publicado: (2025) -
Small Language Model Meets with Reinforced Vision Vocabulary
por: Wei, Haoran, et al.
Publicado: (2024) -
Perception-R1: Pioneering Perception Policy with Reinforcement Learning
por: Yu, En, et al.
Publicado: (2025) -
OneChart: Purify the Chart Structural Extraction via One Auxiliary Token
por: Chen, Jinyue, et al.
Publicado: (2024) -
Perception in Reflection
por: Wei, Yana, et al.
Publicado: (2025)