MageBench: Bridging Large Multimodal Models to Agents
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhang, Miaosen, Dai, Qi, Yang, Yifan, Bao, Jianmin, Chen, Dongdong, Qiu, Kai, Luo, Chong, Geng, Xin, Guo, Baining |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Phi-Ground Tech Report: Advancing Perception in GUI Grounding
von: Zhang, Miaosen, et al.
Veröffentlicht: (2025)
von: Zhang, Miaosen, et al.
Veröffentlicht: (2025)
Aligning Vision Models with Human Aesthetics in Retrieval: Benchmarks and Algorithms
von: Zhang, Miaosen, et al.
Veröffentlicht: (2024)
von: Zhang, Miaosen, et al.
Veröffentlicht: (2024)
Towards On-Policy SFT: Distribution Discriminant Theory and its Applications in LLM Training
von: Zhang, Miaosen, et al.
Veröffentlicht: (2026)
von: Zhang, Miaosen, et al.
Veröffentlicht: (2026)
Covering Human Action Space for Computer Use: Data Synthesis and Benchmark
von: Zhang, Miaosen, et al.
Veröffentlicht: (2026)
von: Zhang, Miaosen, et al.
Veröffentlicht: (2026)
REDUCIO! Generating 1K Video within 16 Seconds using Extremely Compressed Motion Latents
von: Tian, Rui, et al.
Veröffentlicht: (2024)
von: Tian, Rui, et al.
Veröffentlicht: (2024)
ReasonGen-R1: CoT for Autoregressive Image generation models through SFT and RL
von: Zhang, Yu, et al.
Veröffentlicht: (2025)
von: Zhang, Yu, et al.
Veröffentlicht: (2025)
CCA: Collaborative Competitive Agents for Image Editing
von: Hang, Tiankai, et al.
Veröffentlicht: (2024)
von: Hang, Tiankai, et al.
Veröffentlicht: (2024)
Diffusion Models without Classifier-free Guidance
von: Tang, Zhicong, et al.
Veröffentlicht: (2025)
von: Tang, Zhicong, et al.
Veröffentlicht: (2025)
CCEdit: Creative and Controllable Video Editing via Diffusion Models
von: Feng, Ruoyu, et al.
Veröffentlicht: (2023)
von: Feng, Ruoyu, et al.
Veröffentlicht: (2023)
Efficient Diffusion Training via Min-SNR Weighting Strategy
von: Hang, Tiankai, et al.
Veröffentlicht: (2023)
von: Hang, Tiankai, et al.
Veröffentlicht: (2023)
MicroCinema: A Divide-and-Conquer Approach for Text-to-Video Generation
von: Wang, Yanhui, et al.
Veröffentlicht: (2023)
von: Wang, Yanhui, et al.
Veröffentlicht: (2023)
VideoMage: Multi-Subject and Motion Customization of Text-to-Video Diffusion Models
von: Huang, Chi-Pin, et al.
Veröffentlicht: (2025)
von: Huang, Chi-Pin, et al.
Veröffentlicht: (2025)
Improved Noise Schedule for Diffusion Training
von: Hang, Tiankai, et al.
Veröffentlicht: (2024)
von: Hang, Tiankai, et al.
Veröffentlicht: (2024)
HiTVideo: Hierarchical Tokenizers for Enhancing Text-to-Video Generation with Autoregressive Large Language Models
von: Zhou, Ziqin, et al.
Veröffentlicht: (2025)
von: Zhou, Ziqin, et al.
Veröffentlicht: (2025)
MM-WebAgent: A Hierarchical Multimodal Web Agent for Webpage Generation
von: Li, Yan, et al.
Veröffentlicht: (2026)
von: Li, Yan, et al.
Veröffentlicht: (2026)
VolumeDiffusion: Flexible Text-to-3D Generation with Efficient Volumetric Encoder
von: Tang, Zhicong, et al.
Veröffentlicht: (2023)
von: Tang, Zhicong, et al.
Veröffentlicht: (2023)
AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation
von: Zhou, Ziwei, et al.
Veröffentlicht: (2026)
von: Zhou, Ziwei, et al.
Veröffentlicht: (2026)
Language-Guided Face Animation by Recurrent StyleGAN-based Generator
von: Hang, Tiankai, et al.
Veröffentlicht: (2022)
von: Hang, Tiankai, et al.
Veröffentlicht: (2022)
Simplified Diffusion Schrödinger Bridge
von: Tang, Zhicong, et al.
Veröffentlicht: (2024)
von: Tang, Zhicong, et al.
Veröffentlicht: (2024)
VisualAgentBench: Towards Large Multimodal Models as Visual Foundation Agents
von: Liu, Xiao, et al.
Veröffentlicht: (2024)
von: Liu, Xiao, et al.
Veröffentlicht: (2024)
GlobalPaint: Spatiotemporal Coherent Video Outpainting with Global Feature Guidance
von: Pan, Yueming, et al.
Veröffentlicht: (2026)
von: Pan, Yueming, et al.
Veröffentlicht: (2026)
ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning
von: Xu, Ziqiang, et al.
Veröffentlicht: (2025)
von: Xu, Ziqiang, et al.
Veröffentlicht: (2025)
Incorporating Pre-trained Diffusion Models in Solving the Schrödinger Bridge Problem
von: Tang, Zhicong, et al.
Veröffentlicht: (2025)
von: Tang, Zhicong, et al.
Veröffentlicht: (2025)
OmniVLA: Physically-Grounded Multimodal VLA with Unified Multi-Sensor Perception for Robotic Manipulation
von: Guo, Heyu, et al.
Veröffentlicht: (2025)
von: Guo, Heyu, et al.
Veröffentlicht: (2025)
LLM2CLIP: Powerful Language Model Unlocks Richer Cross-Modality Representation
von: Huang, Weiquan, et al.
Veröffentlicht: (2024)
von: Huang, Weiquan, et al.
Veröffentlicht: (2024)
SmokeBench: Evaluating Multimodal Large Language Models for Wildfire Smoke Detection
von: Qi, Tianye, et al.
Veröffentlicht: (2025)
von: Qi, Tianye, et al.
Veröffentlicht: (2025)
MM-SafetyBench: A Benchmark for Safety Evaluation of Multimodal Large Language Models
von: Liu, Xin, et al.
Veröffentlicht: (2023)
von: Liu, Xin, et al.
Veröffentlicht: (2023)
VASA-1: Lifelike Audio-Driven Talking Faces Generated in Real Time
von: Xu, Sicheng, et al.
Veröffentlicht: (2024)
von: Xu, Sicheng, et al.
Veröffentlicht: (2024)
OIG-Bench: A Multi-Agent Annotated Benchmark for Multimodal One-Image Guides Understanding
von: Xie, Jiancong, et al.
Veröffentlicht: (2025)
von: Xie, Jiancong, et al.
Veröffentlicht: (2025)
Lens: Rethinking Training Efficiency for Foundational Text-to-Image Models
von: Chen, Dong, et al.
Veröffentlicht: (2026)
von: Chen, Dong, et al.
Veröffentlicht: (2026)
NavBench: Probing Multimodal Large Language Models for Embodied Navigation
von: Qiao, Yanyuan, et al.
Veröffentlicht: (2025)
von: Qiao, Yanyuan, et al.
Veröffentlicht: (2025)
ERGeoBench:A Comprehensive Benchmark for Embodied Reasoning and Geo-localization in Multimodal Large Language Models
von: Xue, Kaiwen, et al.
Veröffentlicht: (2026)
von: Xue, Kaiwen, et al.
Veröffentlicht: (2026)
MMDeepResearch-Bench: A Benchmark for Multimodal Deep Research Agents
von: Huang, Peizhou, et al.
Veröffentlicht: (2026)
von: Huang, Peizhou, et al.
Veröffentlicht: (2026)
RelationVLM: Making Large Vision-Language Models Understand Visual Relations
von: Huang, Zhipeng, et al.
Veröffentlicht: (2024)
von: Huang, Zhipeng, et al.
Veröffentlicht: (2024)
ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models
von: Roberts, Jonathan, et al.
Veröffentlicht: (2025)
von: Roberts, Jonathan, et al.
Veröffentlicht: (2025)
VP-Bench: A Comprehensive Benchmark for Visual Prompting in Multimodal Large Language Models
von: Xu, Mingjie, et al.
Veröffentlicht: (2025)
von: Xu, Mingjie, et al.
Veröffentlicht: (2025)
UniG2U-Bench: Do Unified Models Advance Multimodal Understanding?
von: Wen, Zimo, et al.
Veröffentlicht: (2026)
von: Wen, Zimo, et al.
Veröffentlicht: (2026)
VideoAesBench: Benchmarking the Video Aesthetics Perception Capabilities of Large Multimodal Models
von: Li, Yunhao, et al.
Veröffentlicht: (2026)
von: Li, Yunhao, et al.
Veröffentlicht: (2026)
Aggregated Contextual Transformations for High-Resolution Image Inpainting
von: Zeng, Yanhong, et al.
Veröffentlicht: (2021)
von: Zeng, Yanhong, et al.
Veröffentlicht: (2021)
Semantic Image Synthesis via Diffusion Models
von: Zhou, Wengang, et al.
Veröffentlicht: (2022)
von: Zhou, Wengang, et al.
Veröffentlicht: (2022)
Ähnliche Einträge
-
Phi-Ground Tech Report: Advancing Perception in GUI Grounding
von: Zhang, Miaosen, et al.
Veröffentlicht: (2025) -
Aligning Vision Models with Human Aesthetics in Retrieval: Benchmarks and Algorithms
von: Zhang, Miaosen, et al.
Veröffentlicht: (2024) -
Towards On-Policy SFT: Distribution Discriminant Theory and its Applications in LLM Training
von: Zhang, Miaosen, et al.
Veröffentlicht: (2026) -
Covering Human Action Space for Computer Use: Data Synthesis and Benchmark
von: Zhang, Miaosen, et al.
Veröffentlicht: (2026) -
REDUCIO! Generating 1K Video within 16 Seconds using Extremely Compressed Motion Latents
von: Tian, Rui, et al.
Veröffentlicht: (2024)