Enregistré dans:
| Auteurs principaux: | Zhou, Pengfei, Peng, Xiaopeng, Song, Jiajun, Li, Chuanhao, Xu, Zhaopan, Yang, Yue, Guo, Ziyao, Zhang, Hao, Lin, Yuqi, He, Yefei, Zhao, Lirui, Liu, Shuo, Li, Tianhua, Xie, Yuxuan, Chang, Xiaojun, Qiao, Yu, Shao, Wenqi, Zhang, Kaipeng |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2411.18499 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
TP-Eval: Tap Multimodal LLMs' Potential in Evaluation by Customizing Prompts
par: Xie, Yuxuan, et autres
Publié: (2024)
par: Xie, Yuxuan, et autres
Publié: (2024)
MDK12-Bench: A Comprehensive Evaluation of Multimodal Large Language Models on Multidisciplinary Exams
par: Zhou, Pengfei, et autres
Publié: (2025)
par: Zhou, Pengfei, et autres
Publié: (2025)
MPBench: A Comprehensive Multimodal Reasoning Benchmark for Process Errors Identification
par: Xu, Zhaopan, et autres
Publié: (2025)
par: Xu, Zhaopan, et autres
Publié: (2025)
ProJudge: A Multi-Modal Multi-Discipline Benchmark and Instruction-Tuning Dataset for MLLM-based Process Judges
par: Ai, Jiaxin, et autres
Publié: (2025)
par: Ai, Jiaxin, et autres
Publié: (2025)
ConvBench: A Multi-Turn Conversation Evaluation Benchmark with Hierarchical Capability for Large Vision-Language Models
par: Liu, Shuo, et autres
Publié: (2024)
par: Liu, Shuo, et autres
Publié: (2024)
Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans
par: Qiu, Yansheng, et autres
Publié: (2025)
par: Qiu, Yansheng, et autres
Publié: (2025)
SearchLVLMs: A Plug-and-Play Framework for Augmenting Large Vision-Language Models by Searching Up-to-Date Internet Knowledge
par: Li, Chuanhao, et autres
Publié: (2024)
par: Li, Chuanhao, et autres
Publié: (2024)
MDK12-Bench: A Multi-Discipline Benchmark for Evaluating Reasoning in Multimodal Large Language Models
par: Zhou, Pengfei, et autres
Publié: (2025)
par: Zhou, Pengfei, et autres
Publié: (2025)
ARMOR: Empowering Multimodal Understanding Model with Interleaved Multimodal Generation Capability
par: Sun, Jianwen, et autres
Publié: (2025)
par: Sun, Jianwen, et autres
Publié: (2025)
DiffAgent: Fast and Accurate Text-to-Image API Selection with Large Language Model
par: Zhao, Lirui, et autres
Publié: (2024)
par: Zhao, Lirui, et autres
Publié: (2024)
Diffree: Text-Guided Shape Free Object Inpainting with Diffusion Model
par: Zhao, Lirui, et autres
Publié: (2024)
par: Zhao, Lirui, et autres
Publié: (2024)
Open-Vocabulary Animal Keypoint Detection with Semantic-feature Matching
par: Zhang, Hao, et autres
Publié: (2023)
par: Zhang, Hao, et autres
Publié: (2023)
A High-Quality Dataset and Reliable Evaluation for Interleaved Image-Text Generation
par: Feng, Yukang, et autres
Publié: (2025)
par: Feng, Yukang, et autres
Publié: (2025)
PEBench: A Fictitious Dataset to Benchmark Machine Unlearning for Multimodal Large Language Models
par: Xu, Zhaopan, et autres
Publié: (2025)
par: Xu, Zhaopan, et autres
Publié: (2025)
OmniQuant: Omnidirectionally Calibrated Quantization for Large Language Models
par: Shao, Wenqi, et autres
Publié: (2023)
par: Shao, Wenqi, et autres
Publié: (2023)
ZipVL: Efficient Large Vision-Language Models with Dynamic Token Sparsification
par: He, Yefei, et autres
Publié: (2024)
par: He, Yefei, et autres
Publié: (2024)
AI Idea Bench 2025: AI Research Idea Generation Benchmark
par: Qiu, Yansheng, et autres
Publié: (2025)
par: Qiu, Yansheng, et autres
Publié: (2025)
Improving Autoregressive Image Generation through Coarse-to-Fine Token Prediction
par: Guo, Ziyao, et autres
Publié: (2025)
par: Guo, Ziyao, et autres
Publié: (2025)
AgentCPM-Report: Interleaving Drafting and Deepening for Open-Ended Deep Research
par: Li, Yishan, et autres
Publié: (2026)
par: Li, Yishan, et autres
Publié: (2026)
Scrambling Enabled Entropy Accumulation in Open Quantum Systems
par: Zhang, Yuke, et autres
Publié: (2025)
par: Zhang, Yuke, et autres
Publié: (2025)
ProBench: Judging Multimodal Foundation Models on Open-ended Multi-domain Expert Tasks
par: Yang, Yan, et autres
Publié: (2025)
par: Yang, Yan, et autres
Publié: (2025)
IA-T2I: Internet-Augmented Text-to-Image Generation
par: Li, Chuanhao, et autres
Publié: (2025)
par: Li, Chuanhao, et autres
Publié: (2025)
ANOLE: An Open, Autoregressive, Native Large Multimodal Models for Interleaved Image-Text Generation
par: Chern, Ethan, et autres
Publié: (2024)
par: Chern, Ethan, et autres
Publié: (2024)
Open-Nav: Exploring Zero-Shot Vision-and-Language Navigation in Continuous Environment with Open-Source LLMs
par: Qiao, Yanyuan, et autres
Publié: (2024)
par: Qiao, Yanyuan, et autres
Publié: (2024)
Yume-1.5: A Text-Controlled Interactive World Generation Model
par: Mao, Xiaofeng, et autres
Publié: (2025)
par: Mao, Xiaofeng, et autres
Publié: (2025)
UniFork: Exploring Modality Alignment for Unified Multimodal Understanding and Generation
par: Li, Teng, et autres
Publié: (2025)
par: Li, Teng, et autres
Publié: (2025)
MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models
par: Meng, Fanqing, et autres
Publié: (2024)
par: Meng, Fanqing, et autres
Publié: (2024)
S-Agents: Self-organizing Agents in Open-ended Environments
par: Chen, Jiaqi, et autres
Publié: (2024)
par: Chen, Jiaqi, et autres
Publié: (2024)
PyVision-RL: Forging Open Agentic Vision Models via RL
par: Zhao, Shitian, et autres
Publié: (2026)
par: Zhao, Shitian, et autres
Publié: (2026)
SAMRefiner: Taming Segment Anything Model for Universal Mask Refinement
par: Lin, Yuqi, et autres
Publié: (2025)
par: Lin, Yuqi, et autres
Publié: (2025)
PackForcing: Short Video Training Suffices for Long Video Sampling and Long Context Inference
par: Mao, Xiaofeng, et autres
Publié: (2026)
par: Mao, Xiaofeng, et autres
Publié: (2026)
SridBench: Benchmark of Scientific Research Illustration Drawing of Image Generation Model
par: Chang, Yifan, et autres
Publié: (2025)
par: Chang, Yifan, et autres
Publié: (2025)
SVBench: Evaluation of Video Generation Models on Social Reasoning
par: Peng, Wenshuo, et autres
Publié: (2025)
par: Peng, Wenshuo, et autres
Publié: (2025)
Sekai: A Video Dataset towards World Exploration
par: Li, Zhen, et autres
Publié: (2025)
par: Li, Zhen, et autres
Publié: (2025)
Towards Lossless Dataset Distillation via Difficulty-Aligned Trajectory Matching
par: Guo, Ziyao, et autres
Publié: (2023)
par: Guo, Ziyao, et autres
Publié: (2023)
Rethinking Rubric Generation for Improving LLM Judge and Reward Modeling for Open-ended Tasks
par: Shen, William F., et autres
Publié: (2026)
par: Shen, William F., et autres
Publié: (2026)
A Judge-free LLM Open-ended Generation Benchmark Based on the Distributional Hypothesis
par: Imajo, Kentaro, et autres
Publié: (2025)
par: Imajo, Kentaro, et autres
Publié: (2025)
Yume: An Interactive World Generation Model
par: Mao, Xiaofeng, et autres
Publié: (2025)
par: Mao, Xiaofeng, et autres
Publié: (2025)
Towards Open-ended Visual Quality Comparison
par: Wu, Haoning, et autres
Publié: (2024)
par: Wu, Haoning, et autres
Publié: (2024)
Rethinking Human Evaluation Protocol for Text-to-Video Models: Enhancing Reliability,Reproducibility, and Practicality
par: Zhang, Tianle, et autres
Publié: (2024)
par: Zhang, Tianle, et autres
Publié: (2024)
Documents similaires
-
TP-Eval: Tap Multimodal LLMs' Potential in Evaluation by Customizing Prompts
par: Xie, Yuxuan, et autres
Publié: (2024) -
MDK12-Bench: A Comprehensive Evaluation of Multimodal Large Language Models on Multidisciplinary Exams
par: Zhou, Pengfei, et autres
Publié: (2025) -
MPBench: A Comprehensive Multimodal Reasoning Benchmark for Process Errors Identification
par: Xu, Zhaopan, et autres
Publié: (2025) -
ProJudge: A Multi-Modal Multi-Discipline Benchmark and Instruction-Tuning Dataset for MLLM-based Process Judges
par: Ai, Jiaxin, et autres
Publié: (2025) -
ConvBench: A Multi-Turn Conversation Evaluation Benchmark with Hierarchical Capability for Large Vision-Language Models
par: Liu, Shuo, et autres
Publié: (2024)