VisualPuzzles: Decoupling Multimodal Reasoning Evaluation from Domain Knowledge
Fuente:
arXiv
Salvato in:
| Autori principali: | Song, Yueqi, Ou, Tianyue, Kong, Yibo, Li, Zecheng, Neubig, Graham, Yue, Xiang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
What Is Missing in Multilingual Visual Reasoning and How to Fix It
di: Song, Yueqi, et al.
Pubblicazione: (2024)
di: Song, Yueqi, et al.
Pubblicazione: (2024)
Grounding Multilingual Multimodal LLMs With Cultural Knowledge
di: Nyandwi, Jean de Dieu, et al.
Pubblicazione: (2025)
di: Nyandwi, Jean de Dieu, et al.
Pubblicazione: (2025)
Harnessing Webpage UIs for Text-Rich Visual Understanding
di: Liu, Junpeng, et al.
Pubblicazione: (2024)
di: Liu, Junpeng, et al.
Pubblicazione: (2024)
On the Interplay of Pre-Training, Mid-Training, and RL on Reasoning Language Models
di: Zhang, Charlie, et al.
Pubblicazione: (2025)
di: Zhang, Charlie, et al.
Pubblicazione: (2025)
An image speaks a thousand words, but can everyone listen? On image transcreation for cultural relevance
di: Khanuja, Simran, et al.
Pubblicazione: (2024)
di: Khanuja, Simran, et al.
Pubblicazione: (2024)
Beyond Browsing: API-Based Web Agents
di: Song, Yueqi, et al.
Pubblicazione: (2024)
di: Song, Yueqi, et al.
Pubblicazione: (2024)
VisualWebBench: How Far Have Multimodal LLMs Evolved in Web Page Understanding and Grounding?
di: Liu, Junpeng, et al.
Pubblicazione: (2024)
di: Liu, Junpeng, et al.
Pubblicazione: (2024)
Demystifying Long Chain-of-Thought Reasoning in LLMs
di: Yeo, Edward, et al.
Pubblicazione: (2025)
di: Yeo, Edward, et al.
Pubblicazione: (2025)
Pangea: A Fully Open Multilingual Multimodal LLM for 39 Languages
di: Yue, Xiang, et al.
Pubblicazione: (2024)
di: Yue, Xiang, et al.
Pubblicazione: (2024)
MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale
di: Guo, Jarvis, et al.
Pubblicazione: (2024)
di: Guo, Jarvis, et al.
Pubblicazione: (2024)
Scaling Evaluation-time Compute with Reasoning Models as Evaluators
di: Kim, Seungone, et al.
Pubblicazione: (2025)
di: Kim, Seungone, et al.
Pubblicazione: (2025)
JMMMU: A Japanese Massive Multi-discipline Multimodal Understanding Benchmark for Culture-aware Evaluation
di: Onohara, Shota, et al.
Pubblicazione: (2024)
di: Onohara, Shota, et al.
Pubblicazione: (2024)
CowPilot: A Framework for Autonomous and Human-Agent Collaborative Web Navigation
di: Huq, Faria, et al.
Pubblicazione: (2025)
di: Huq, Faria, et al.
Pubblicazione: (2025)
Oolong: Evaluating Long Context Reasoning and Aggregation Capabilities
di: Bertsch, Amanda, et al.
Pubblicazione: (2025)
di: Bertsch, Amanda, et al.
Pubblicazione: (2025)
Go-Browse: Training Web Agents with Structured Exploration
di: Gandhi, Apurva, et al.
Pubblicazione: (2025)
di: Gandhi, Apurva, et al.
Pubblicazione: (2025)
BehaviorBox: Automated Discovery of Fine-Grained Performance Differences Between Language Models
di: Tjuatja, Lindia, et al.
Pubblicazione: (2025)
di: Tjuatja, Lindia, et al.
Pubblicazione: (2025)
TangramPuzzle: Evaluating Multimodal Large Language Models with Compositional Spatial Reasoning
di: Liu, Daixian, et al.
Pubblicazione: (2026)
di: Liu, Daixian, et al.
Pubblicazione: (2026)
Does Math Reasoning Improve General LLM Capabilities? Understanding Transferability of LLM Reasoning
di: Huan, Maggie, et al.
Pubblicazione: (2025)
di: Huan, Maggie, et al.
Pubblicazione: (2025)
Coding Agents with Multimodal Browsing are Generalist Problem Solvers
di: Soni, Aditya Bharat, et al.
Pubblicazione: (2025)
di: Soni, Aditya Bharat, et al.
Pubblicazione: (2025)
VisualWebArena: Evaluating Multimodal Agents on Realistic Visual Web Tasks
di: Koh, Jing Yu, et al.
Pubblicazione: (2024)
di: Koh, Jing Yu, et al.
Pubblicazione: (2024)
Can Large Language Models be Trusted for Evaluation? Scalable Meta-Evaluation of LLMs as Evaluators via Agent Debate
di: Chern, Steffi, et al.
Pubblicazione: (2024)
di: Chern, Steffi, et al.
Pubblicazione: (2024)
Analyzing Information Sharing and Coordination in Multi-Agent Planning
di: Ou, Tianyue, et al.
Pubblicazione: (2025)
di: Ou, Tianyue, et al.
Pubblicazione: (2025)
Effective Strategies for Asynchronous Software Engineering Agents
di: Geng, Jiayi, et al.
Pubblicazione: (2026)
di: Geng, Jiayi, et al.
Pubblicazione: (2026)
PuzzleWorld: A Benchmark for Multimodal, Open-Ended Reasoning in Puzzlehunts
di: Li, Hengzhi, et al.
Pubblicazione: (2025)
di: Li, Hengzhi, et al.
Pubblicazione: (2025)
Modeling Distinct Human Interaction in Web Agents
di: Huq, Faria, et al.
Pubblicazione: (2026)
di: Huq, Faria, et al.
Pubblicazione: (2026)
ZINA: Multimodal Fine-grained Hallucination Detection and Editing
di: Wada, Yuiga, et al.
Pubblicazione: (2025)
di: Wada, Yuiga, et al.
Pubblicazione: (2025)
Towards Automatic Evaluation for Image Transcreation
di: Khanuja, Simran, et al.
Pubblicazione: (2024)
di: Khanuja, Simran, et al.
Pubblicazione: (2024)
Checklists Are Better Than Reward Models For Aligning Language Models
di: Viswanathan, Vijay, et al.
Pubblicazione: (2025)
di: Viswanathan, Vijay, et al.
Pubblicazione: (2025)
MMNeuron: Discovering Neuron-Level Domain-Specific Interpretation in Multimodal Large Language Model
di: Huo, Jiahao, et al.
Pubblicazione: (2024)
di: Huo, Jiahao, et al.
Pubblicazione: (2024)
Gained in Translation: Privileged Pairwise Judges Enhance Multilingual Reasoning
di: Sutawika, Lintang, et al.
Pubblicazione: (2026)
di: Sutawika, Lintang, et al.
Pubblicazione: (2026)
Mix-CPT: A Domain Adaptation Framework via Decoupling Knowledge Learning and Format Alignment
di: Jiang, Jinhao, et al.
Pubblicazione: (2024)
di: Jiang, Jinhao, et al.
Pubblicazione: (2024)
GM-PRM: A Generative Multimodal Process Reward Model for Multimodal Mathematical Reasoning
di: Zhang, Jianghangfan, et al.
Pubblicazione: (2025)
di: Zhang, Jianghangfan, et al.
Pubblicazione: (2025)
Midtraining Bridges Pretraining and Posttraining Distributions
di: Liu, Emmy, et al.
Pubblicazione: (2025)
di: Liu, Emmy, et al.
Pubblicazione: (2025)
An Incomplete Loop: Instruction Inference, Instruction Following, and In-context Learning in Language Models
di: Liu, Emmy, et al.
Pubblicazione: (2024)
di: Liu, Emmy, et al.
Pubblicazione: (2024)
Solving NLP Problems through Human-System Collaboration: A Discussion-based Approach
di: Kaneko, Masahiro, et al.
Pubblicazione: (2023)
di: Kaneko, Masahiro, et al.
Pubblicazione: (2023)
Evaluating Language Models as Synthetic Data Generators
di: Kim, Seungone, et al.
Pubblicazione: (2024)
di: Kim, Seungone, et al.
Pubblicazione: (2024)
From Evidence-Based Medicine to Knowledge Graph: Retrieval-Augmented Generation for Sports Rehabilitation and a Domain Benchmark
di: Zhang, Jinning, et al.
Pubblicazione: (2026)
di: Zhang, Jinning, et al.
Pubblicazione: (2026)
Multi-Turn Puzzles: Evaluating Interactive Reasoning and Strategic Dialogue in LLMs
di: Badola, Kartikeya, et al.
Pubblicazione: (2025)
di: Badola, Kartikeya, et al.
Pubblicazione: (2025)
Language Modeling with Editable External Knowledge
di: Li, Belinda Z., et al.
Pubblicazione: (2024)
di: Li, Belinda Z., et al.
Pubblicazione: (2024)
Decoupling Reasoning and Knowledge Injection for In-Context Knowledge Editing
di: Wang, Changyue, et al.
Pubblicazione: (2025)
di: Wang, Changyue, et al.
Pubblicazione: (2025)
Documenti analoghi
-
What Is Missing in Multilingual Visual Reasoning and How to Fix It
di: Song, Yueqi, et al.
Pubblicazione: (2024) -
Grounding Multilingual Multimodal LLMs With Cultural Knowledge
di: Nyandwi, Jean de Dieu, et al.
Pubblicazione: (2025) -
Harnessing Webpage UIs for Text-Rich Visual Understanding
di: Liu, Junpeng, et al.
Pubblicazione: (2024) -
On the Interplay of Pre-Training, Mid-Training, and RL on Reasoning Language Models
di: Zhang, Charlie, et al.
Pubblicazione: (2025) -
An image speaks a thousand words, but can everyone listen? On image transcreation for cultural relevance
di: Khanuja, Simran, et al.
Pubblicazione: (2024)