Guardado en:
| Autores principales: | Ma, Zhantao, Lu, Quanfeng, Zhong, Shuai, Yu, Dahai, Luo, Ping, Ng, Michael K. |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2601.13142 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SWIRL: A Staged Workflow for Interleaved Reinforcement Learning in Mobile GUI Control
por: Lu, Quanfeng, et al.
Publicado: (2025)
por: Lu, Quanfeng, et al.
Publicado: (2025)
VisualAgentBench: Towards Large Multimodal Models as Visual Foundation Agents
por: Liu, Xiao, et al.
Publicado: (2024)
por: Liu, Xiao, et al.
Publicado: (2024)
ADAM: An Embodied Causal Agent in Open-World Environments
por: Yu, Shu, et al.
Publicado: (2024)
por: Yu, Shu, et al.
Publicado: (2024)
TV2TV: A Unified Framework for Interleaved Language and Video Generation
por: Han, Xiaochuang, et al.
Publicado: (2025)
por: Han, Xiaochuang, et al.
Publicado: (2025)
NExT-OMNI: Towards Any-to-Any Omnimodal Foundation Models with Discrete Flow Matching
por: Luo, Run, et al.
Publicado: (2025)
por: Luo, Run, et al.
Publicado: (2025)
From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models
por: Jin, Haibo, et al.
Publicado: (2025)
por: Jin, Haibo, et al.
Publicado: (2025)
Historical Test-time Prompt Tuning for Vision Foundation Models
por: Zhang, Jingyi, et al.
Publicado: (2024)
por: Zhang, Jingyi, et al.
Publicado: (2024)
Survey of Video Diffusion Models: Foundations, Implementations, and Applications
por: Wang, Yimu, et al.
Publicado: (2025)
por: Wang, Yimu, et al.
Publicado: (2025)
Inquire, Interact, and Integrate: A Proactive Agent Collaborative Framework for Zero-Shot Multimodal Medical Reasoning
por: Gu, Zishan, et al.
Publicado: (2024)
por: Gu, Zishan, et al.
Publicado: (2024)
GUI-G1: Understanding R1-Zero-Like Training for Visual Grounding in GUI Agents
por: Zhou, Yuqi, et al.
Publicado: (2025)
por: Zhou, Yuqi, et al.
Publicado: (2025)
Many-Shot In-Context Learning in Multimodal Foundation Models
por: Jiang, Yixing, et al.
Publicado: (2024)
por: Jiang, Yixing, et al.
Publicado: (2024)
Efficient Adaptation For Remote Sensing Visual Grounding
por: Moughnieh, Hasan, et al.
Publicado: (2025)
por: Moughnieh, Hasan, et al.
Publicado: (2025)
Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation
por: Wu, Chengyue, et al.
Publicado: (2024)
por: Wu, Chengyue, et al.
Publicado: (2024)
VideoSeek: Long-Horizon Video Agent with Tool-Guided Seeking
por: Lin, Jingyang, et al.
Publicado: (2026)
por: Lin, Jingyang, et al.
Publicado: (2026)
Where is the multimodal goal post? On the Ability of Foundation Models to Recognize Contextually Important Moments
por: Surikuchi, Aditya K, et al.
Publicado: (2026)
por: Surikuchi, Aditya K, et al.
Publicado: (2026)
Multimodal Foundation Models Exploit Text to Make Medical Image Predictions
por: Buckley, Thomas, et al.
Publicado: (2023)
por: Buckley, Thomas, et al.
Publicado: (2023)
EVA: Efficient Reinforcement Learning for End-to-End Video Agent
por: Zhang, Yaolun, et al.
Publicado: (2026)
por: Zhang, Yaolun, et al.
Publicado: (2026)
SkillWeaver: Web Agents can Self-Improve by Discovering and Honing Skills
por: Zheng, Boyuan, et al.
Publicado: (2025)
por: Zheng, Boyuan, et al.
Publicado: (2025)
CorNav: Autonomous Agent with Self-Corrected Planning for Zero-Shot Vision-and-Language Navigation
por: Liang, Xiwen, et al.
Publicado: (2023)
por: Liang, Xiwen, et al.
Publicado: (2023)
Interfacing Foundation Models' Embeddings
por: Zou, Xueyan, et al.
Publicado: (2023)
por: Zou, Xueyan, et al.
Publicado: (2023)
MM-WebAgent: A Hierarchical Multimodal Web Agent for Webpage Generation
por: Li, Yan, et al.
Publicado: (2026)
por: Li, Yan, et al.
Publicado: (2026)
AI Meets Brain: Memory Systems from Cognitive Neuroscience to Autonomous Agents
por: Liang, Jiafeng, et al.
Publicado: (2025)
por: Liang, Jiafeng, et al.
Publicado: (2025)
A Survey of Reasoning with Foundation Models
por: Sun, Jiankai, et al.
Publicado: (2023)
por: Sun, Jiankai, et al.
Publicado: (2023)
Lingshu: A Generalist Foundation Model for Unified Multimodal Medical Understanding and Reasoning
por: LASA Team, et al.
Publicado: (2025)
por: LASA Team, et al.
Publicado: (2025)
AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
por: Ahn, Michael, et al.
Publicado: (2024)
por: Ahn, Michael, et al.
Publicado: (2024)
WebGuard: Building a Generalizable Guardrail for Web Agents
por: Zheng, Boyuan, et al.
Publicado: (2025)
por: Zheng, Boyuan, et al.
Publicado: (2025)
Breaking Down and Building Up: Mixture of Skill-Based Vision-and-Language Navigation Agents
por: Ma, Tianyi, et al.
Publicado: (2025)
por: Ma, Tianyi, et al.
Publicado: (2025)
InternAgent: When Agent Becomes the Scientist -- Building Closed-Loop System from Hypothesis to Verification
por: InternAgent Team, et al.
Publicado: (2025)
por: InternAgent Team, et al.
Publicado: (2025)
Diffusion-RSCC: Diffusion Probabilistic Model for Change Captioning in Remote Sensing Images
por: Yu, Xiaofei, et al.
Publicado: (2024)
por: Yu, Xiaofei, et al.
Publicado: (2024)
DriVLMe: Enhancing LLM-based Autonomous Driving Agents with Embodied and Social Experiences
por: Huang, Yidong, et al.
Publicado: (2024)
por: Huang, Yidong, et al.
Publicado: (2024)
Breaking the Data Barrier -- Building GUI Agents Through Task Generalization
por: Zhang, Junlei, et al.
Publicado: (2025)
por: Zhang, Junlei, et al.
Publicado: (2025)
InfiniteWeb: Scalable Web Environment Synthesis for GUI Agent Training
por: Zhang, Ziyun, et al.
Publicado: (2026)
por: Zhang, Ziyun, et al.
Publicado: (2026)
Failure Makes the Agent Stronger: Enhancing Accuracy through Structured Reflection for Reliable Tool Interactions
por: Su, Junhao, et al.
Publicado: (2025)
por: Su, Junhao, et al.
Publicado: (2025)
Dyna-Mind: Learning to Simulate from Experience for Better AI Agents
por: Yu, Xiao, et al.
Publicado: (2025)
por: Yu, Xiao, et al.
Publicado: (2025)
Thinking with Map: Reinforced Parallel Map-Augmented Agent for Geolocalization
por: Ji, Yuxiang, et al.
Publicado: (2026)
por: Ji, Yuxiang, et al.
Publicado: (2026)
Uni-MoE: Scaling Unified Multimodal LLMs with Mixture of Experts
por: Li, Yunxin, et al.
Publicado: (2024)
por: Li, Yunxin, et al.
Publicado: (2024)
EPEE: Towards Efficient and Effective Foundation Models in Biomedicine
por: Zhan, Zaifu, et al.
Publicado: (2025)
por: Zhan, Zaifu, et al.
Publicado: (2025)
Evaluation Agent: Efficient and Promptable Evaluation Framework for Visual Generative Models
por: Zhang, Fan, et al.
Publicado: (2024)
por: Zhang, Fan, et al.
Publicado: (2024)
MindBench: A Comprehensive Benchmark for Mind Map Structure Recognition and Analysis
por: Chen, Lei, et al.
Publicado: (2024)
por: Chen, Lei, et al.
Publicado: (2024)
ComfyBench: Benchmarking LLM-based Agents in ComfyUI for Autonomously Designing Collaborative AI Systems
por: Xue, Xiangyuan, et al.
Publicado: (2024)
por: Xue, Xiangyuan, et al.
Publicado: (2024)
Ejemplares similares
-
SWIRL: A Staged Workflow for Interleaved Reinforcement Learning in Mobile GUI Control
por: Lu, Quanfeng, et al.
Publicado: (2025) -
VisualAgentBench: Towards Large Multimodal Models as Visual Foundation Agents
por: Liu, Xiao, et al.
Publicado: (2024) -
ADAM: An Embodied Causal Agent in Open-World Environments
por: Yu, Shu, et al.
Publicado: (2024) -
TV2TV: A Unified Framework for Interleaved Language and Video Generation
por: Han, Xiaochuang, et al.
Publicado: (2025) -
NExT-OMNI: Towards Any-to-Any Omnimodal Foundation Models with Discrete Flow Matching
por: Luo, Run, et al.
Publicado: (2025)