Enregistré dans:
| Auteurs principaux: | Ding, Xuanwen, Pan, Chengjun, Li, Zejun, Zhang, Jiwen, Wang, Siyuan, Wei, Zhongyu |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2505.21389 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
HyLaT: Efficient Multi-Agent Communication via Hybrid Latent-Text Protocol
par: Mou, Xinyi, et autres
Publié: (2026)
par: Mou, Xinyi, et autres
Publié: (2026)
AutoJudge: Judge Decoding Without Manual Annotation
par: Garipov, Roman, et autres
Publié: (2025)
par: Garipov, Roman, et autres
Publié: (2025)
From LLMs to MLLMs: Exploring the Landscape of Multimodal Jailbreaking
par: Wang, Siyuan, et autres
Publié: (2024)
par: Wang, Siyuan, et autres
Publié: (2024)
Benchmark Self-Evolving: A Multi-Agent Framework for Dynamic LLM Evaluation
par: Wang, Siyuan, et autres
Publié: (2024)
par: Wang, Siyuan, et autres
Publié: (2024)
VoCoT: Unleashing Visually Grounded Multi-Step Reasoning in Large Multi-Modal Models
par: Li, Zejun, et autres
Publié: (2024)
par: Li, Zejun, et autres
Publié: (2024)
From Individual to Society: A Survey on Social Simulation Driven by Large Language Model-based Agents
par: Mou, Xinyi, et autres
Publié: (2024)
par: Mou, Xinyi, et autres
Publié: (2024)
OViP: Online Vision-Language Preference Learning for VLM Hallucination
par: Liu, Shujun, et autres
Publié: (2025)
par: Liu, Shujun, et autres
Publié: (2025)
Synergistic Multi-Agent Framework with Trajectory Learning for Knowledge-Intensive Tasks
par: Yue, Shengbin, et autres
Publié: (2024)
par: Yue, Shengbin, et autres
Publié: (2024)
DELAN: Dual-Level Alignment for Vision-and-Language Navigation by Cross-Modal Contrastive Learning
par: Du, Mengfei, et autres
Publié: (2024)
par: Du, Mengfei, et autres
Publié: (2024)
SpatialNav: Leveraging Spatial Scene Graphs for Zero-Shot Vision-and-Language Navigation
par: Zhang, Jiwen, et autres
Publié: (2026)
par: Zhang, Jiwen, et autres
Publié: (2026)
EmbSpatial-Bench: Benchmarking Spatial Understanding for Embodied Tasks with Large Vision-Language Models
par: Du, Mengfei, et autres
Publié: (2024)
par: Du, Mengfei, et autres
Publié: (2024)
Stepwise Informativeness Search for Efficient and Effective LLM Reasoning
par: Wang, Siyuan, et autres
Publié: (2025)
par: Wang, Siyuan, et autres
Publié: (2025)
MAGNET: Towards Adaptive GUI Agents with Memory-Driven Knowledge Evolution
par: Sun, Libo, et autres
Publié: (2026)
par: Sun, Libo, et autres
Publié: (2026)
MedRCube: A Multidimensional Framework for Fine-Grained and In-Depth Evaluation of MLLMs in Medical Imaging
par: Bao, Zhijie, et autres
Publié: (2026)
par: Bao, Zhijie, et autres
Publié: (2026)
CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards
par: Zhang, Taolin, et autres
Publié: (2025)
par: Zhang, Taolin, et autres
Publié: (2025)
Affordance Benchmark for MLLMs
par: Wang, Junying, et autres
Publié: (2025)
par: Wang, Junying, et autres
Publié: (2025)
Can LLMs Reason with Rules? Logic Scaffolding for Stress-Testing and Improving LLMs
par: Wang, Siyuan, et autres
Publié: (2024)
par: Wang, Siyuan, et autres
Publié: (2024)
Symbolic Working Memory Enhances Language Models for Complex Rule Application
par: Wang, Siyuan, et autres
Publié: (2024)
par: Wang, Siyuan, et autres
Publié: (2024)
CompassJudger-1: All-in-one Judge Model Helps Model Evaluation and Evolution
par: Cao, Maosong, et autres
Publié: (2024)
par: Cao, Maosong, et autres
Publié: (2024)
Android in the Zoo: Chain-of-Action-Thought for GUI Agents
par: Zhang, Jiwen, et autres
Publié: (2024)
par: Zhang, Jiwen, et autres
Publié: (2024)
CommunityBench: Benchmarking Community-Level Alignment across Diverse Groups and Tasks
par: Lin, Jiayu, et autres
Publié: (2026)
par: Lin, Jiayu, et autres
Publié: (2026)
AI Hospital: Benchmarking Large Language Models in a Multi-agent Medical Interaction Simulator
par: Fan, Zhihao, et autres
Publié: (2024)
par: Fan, Zhihao, et autres
Publié: (2024)
EcoLANG: Efficient and Effective Agent Communication Language Induction for Social Simulation
par: Mou, Xinyi, et autres
Publié: (2025)
par: Mou, Xinyi, et autres
Publié: (2025)
Redundancy Principles for MLLMs Benchmarks
par: Zhang, Zicheng, et autres
Publié: (2025)
par: Zhang, Zicheng, et autres
Publié: (2025)
StreamProfileBench: A Benchmark for Fine-Grained User Profile Inference in Real-World Streaming Scenarios
par: Wang, Sizhe, et autres
Publié: (2026)
par: Wang, Sizhe, et autres
Publié: (2026)
HAF-RM: A Hybrid Alignment Framework for Reward Model Training
par: Liu, Shujun, et autres
Publié: (2024)
par: Liu, Shujun, et autres
Publié: (2024)
Visual Contextual Attack: Jailbreaking MLLMs with Image-Driven Context Injection
par: Miao, Ziqi, et autres
Publié: (2025)
par: Miao, Ziqi, et autres
Publié: (2025)
AgentSense: Benchmarking Social Intelligence of Language Agents through Interactive Scenarios
par: Mou, Xinyi, et autres
Publié: (2024)
par: Mou, Xinyi, et autres
Publié: (2024)
Visual Room 2.0: Seeing is Not Understanding for MLLMs
par: Li, Haokun, et autres
Publié: (2025)
par: Li, Haokun, et autres
Publié: (2025)
Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning
par: Li, Zejun, et autres
Publié: (2025)
par: Li, Zejun, et autres
Publié: (2025)
Multi-Agent Simulator Drives Language Models for Legal Intensive Interaction
par: Yue, Shengbin, et autres
Publié: (2025)
par: Yue, Shengbin, et autres
Publié: (2025)
Interleaved Latent Visual Reasoning with Selective Perceptual Modeling
par: Dong, Shuai, et autres
Publié: (2025)
par: Dong, Shuai, et autres
Publié: (2025)
Unveiling the Truth and Facilitating Change: Towards Agent-based Large-scale Social Movement Simulation
par: Mou, Xinyi, et autres
Publié: (2024)
par: Mou, Xinyi, et autres
Publié: (2024)
AutoLink: Autonomous Schema Exploration and Expansion for Scalable Schema Linking in Text-to-SQL at Scale
par: Wang, Ziyang, et autres
Publié: (2025)
par: Wang, Ziyang, et autres
Publié: (2025)
Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant
par: Shen, Lei, et autres
Publié: (2025)
par: Shen, Lei, et autres
Publié: (2025)
SpeechMedAssist: Efficiently and Effectively Adapting Speech Language Models for Medical Consultation
par: Chen, Sirry, et autres
Publié: (2026)
par: Chen, Sirry, et autres
Publié: (2026)
ALaRM: Align Language Models via Hierarchical Rewards Modeling
par: Lai, Yuhang, et autres
Publié: (2024)
par: Lai, Yuhang, et autres
Publié: (2024)
InsQABench: Benchmarking Chinese Insurance Domain Question Answering with Large Language Models
par: Ding, Jing, et autres
Publié: (2025)
par: Ding, Jing, et autres
Publié: (2025)
Activating Distributed Visual Region within LLMs for Efficient and Effective Vision-Language Training and Inference
par: Wang, Siyuan, et autres
Publié: (2024)
par: Wang, Siyuan, et autres
Publié: (2024)
MathOPEval: A Fine-grained Evaluation Benchmark for Visual Operations of MLLMs in Mathematical Reasoning
par: Li, Xiaoyuan, et autres
Publié: (2025)
par: Li, Xiaoyuan, et autres
Publié: (2025)
Documents similaires
-
HyLaT: Efficient Multi-Agent Communication via Hybrid Latent-Text Protocol
par: Mou, Xinyi, et autres
Publié: (2026) -
AutoJudge: Judge Decoding Without Manual Annotation
par: Garipov, Roman, et autres
Publié: (2025) -
From LLMs to MLLMs: Exploring the Landscape of Multimodal Jailbreaking
par: Wang, Siyuan, et autres
Publié: (2024) -
Benchmark Self-Evolving: A Multi-Agent Framework for Dynamic LLM Evaluation
par: Wang, Siyuan, et autres
Publié: (2024) -
VoCoT: Unleashing Visually Grounded Multi-Step Reasoning in Large Multi-Modal Models
par: Li, Zejun, et autres
Publié: (2024)