Multi-modal Reasoning with LLMs for Visual Semantic Arithmetic
Fuente:
arXiv
Salvato in:
| Autori principali: | Xu, Chuou, Ji, Liya, Chen, Qifeng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Instruction-based Image Editing with Planning, Reasoning, and Generation
di: Ji, Liya, et al.
Pubblicazione: (2026)
di: Ji, Liya, et al.
Pubblicazione: (2026)
Multi-modal Knowledge Graph Generation with Semantics-enriched Prompts
di: Xu, Yajing, et al.
Pubblicazione: (2025)
di: Xu, Yajing, et al.
Pubblicazione: (2025)
Tokenization Constraints in LLMs: A Study of Symbolic and Arithmetic Reasoning Limits
di: Zhang, Xiang, et al.
Pubblicazione: (2025)
di: Zhang, Xiang, et al.
Pubblicazione: (2025)
Probing Cross-modal Information Hubs in Audio-Visual LLMs
di: Jung, Jihoo, et al.
Pubblicazione: (2026)
di: Jung, Jihoo, et al.
Pubblicazione: (2026)
RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought
di: Lu, Yi, et al.
Pubblicazione: (2025)
di: Lu, Yi, et al.
Pubblicazione: (2025)
Multi-modal Generative AI: Multi-modal LLMs, Diffusions, and the Unification
di: Wang, Xin, et al.
Pubblicazione: (2024)
di: Wang, Xin, et al.
Pubblicazione: (2024)
Zero-shot Synthetic Video Realism Enhancement via Structure-aware Denoising
di: Wang, Yifan, et al.
Pubblicazione: (2025)
di: Wang, Yifan, et al.
Pubblicazione: (2025)
MMLU-Reason: Benchmarking Multi-Task Multi-modal Language Understanding and Reasoning
di: Tie, Guiyao, et al.
Pubblicazione: (2025)
di: Tie, Guiyao, et al.
Pubblicazione: (2025)
Fine-R1: Make Multi-modal LLMs Excel in Fine-Grained Visual Recognition by Chain-of-Thought Reasoning
di: He, Hulingxiao, et al.
Pubblicazione: (2026)
di: He, Hulingxiao, et al.
Pubblicazione: (2026)
How Numerical Precision Affects Arithmetical Reasoning Capabilities of LLMs
di: Feng, Guhao, et al.
Pubblicazione: (2024)
di: Feng, Guhao, et al.
Pubblicazione: (2024)
LaViT: Aligning Latent Visual Thoughts for Multi-modal Reasoning
di: Wu, Linquan, et al.
Pubblicazione: (2026)
di: Wu, Linquan, et al.
Pubblicazione: (2026)
Why context matters in VQA and Reasoning: Semantic interventions for VLM input modalities
di: Amara, Kenza, et al.
Pubblicazione: (2024)
di: Amara, Kenza, et al.
Pubblicazione: (2024)
Towards Learning to Reason: Comparing LLMs with Neuro-Symbolic on Arithmetic Relations in Abstract Reasoning
di: Hersche, Michael, et al.
Pubblicazione: (2024)
di: Hersche, Michael, et al.
Pubblicazione: (2024)
Arithmetic Reasoning with LLM: Prolog Generation & Permutation
di: Yang, Xiaocheng, et al.
Pubblicazione: (2024)
di: Yang, Xiaocheng, et al.
Pubblicazione: (2024)
Social Debiasing for Fair Multi-modal LLMs
di: Cheng, Harry, et al.
Pubblicazione: (2024)
di: Cheng, Harry, et al.
Pubblicazione: (2024)
GenSim2: Scaling Robot Data Generation with Multi-modal and Reasoning LLMs
di: Hua, Pu, et al.
Pubblicazione: (2024)
di: Hua, Pu, et al.
Pubblicazione: (2024)
ORIGAMISPACE: Benchmarking Multimodal LLMs in Multi-Step Spatial Reasoning with Mathematical Constraints
di: Xu, Rui, et al.
Pubblicazione: (2025)
di: Xu, Rui, et al.
Pubblicazione: (2025)
Can Multi-modal (reasoning) LLMs work as deepfake detectors?
di: Ren, Simiao, et al.
Pubblicazione: (2025)
di: Ren, Simiao, et al.
Pubblicazione: (2025)
MIND: Multi-rationale INtegrated Discriminative Reasoning Framework for Multi-modal Large Models
di: Yu, Chuang, et al.
Pubblicazione: (2025)
di: Yu, Chuang, et al.
Pubblicazione: (2025)
Robust-R1: Degradation-Aware Reasoning for Robust Visual Understanding
di: Tang, Jiaqi, et al.
Pubblicazione: (2025)
di: Tang, Jiaqi, et al.
Pubblicazione: (2025)
VisScience: An Extensive Benchmark for Evaluating K12 Educational Multi-modal Scientific Reasoning
di: Jiang, Zhihuan, et al.
Pubblicazione: (2024)
di: Jiang, Zhihuan, et al.
Pubblicazione: (2024)
SciVerse: Unveiling the Knowledge Comprehension and Visual Reasoning of LMMs on Multi-modal Scientific Problems
di: Guo, Ziyu, et al.
Pubblicazione: (2025)
di: Guo, Ziyu, et al.
Pubblicazione: (2025)
Principled Understanding of Generalization for Generative Transformer Models in Arithmetic Reasoning Tasks
di: Xu, Xingcheng, et al.
Pubblicazione: (2024)
di: Xu, Xingcheng, et al.
Pubblicazione: (2024)
Mitigating Visual Forgetting via Take-along Visual Conditioning for Multi-modal Long CoT Reasoning
di: Sun, Hai-Long, et al.
Pubblicazione: (2025)
di: Sun, Hai-Long, et al.
Pubblicazione: (2025)
BilliardPhys-Bench: Benchmarking Physical Reasoning and Visual Dynamics of Multimodal LLMs
di: Wang, Ben, et al.
Pubblicazione: (2026)
di: Wang, Ben, et al.
Pubblicazione: (2026)
CrashAgent: Crash Scenario Generation via Multi-modal Reasoning
di: Li, Miao, et al.
Pubblicazione: (2025)
di: Li, Miao, et al.
Pubblicazione: (2025)
Error-Driven Prompt Optimization for Arithmetic Reasoning
di: Pándy, Árpád, et al.
Pubblicazione: (2025)
di: Pándy, Árpád, et al.
Pubblicazione: (2025)
Self-training Language Models for Arithmetic Reasoning
di: Kadlčík, Marek, et al.
Pubblicazione: (2024)
di: Kadlčík, Marek, et al.
Pubblicazione: (2024)
Diffusion-Based Visual Art Creation: A Survey and New Perspectives
di: Wang, Bingyuan, et al.
Pubblicazione: (2024)
di: Wang, Bingyuan, et al.
Pubblicazione: (2024)
Iterative Semantic Reasoning from Individual to Group Interests for Generative Recommendation with LLMs
di: Zhu, Xiaofei, et al.
Pubblicazione: (2026)
di: Zhu, Xiaofei, et al.
Pubblicazione: (2026)
Polymath: A Challenging Multi-modal Mathematical Reasoning Benchmark
di: Gupta, Himanshu, et al.
Pubblicazione: (2024)
di: Gupta, Himanshu, et al.
Pubblicazione: (2024)
Look on Demand: A Cognitive Scheduling Framework for Visual Evidence Acquisition in Multimodal Reasoning
di: Zhang, Yang, et al.
Pubblicazione: (2026)
di: Zhang, Yang, et al.
Pubblicazione: (2026)
Strat-Reasoner: Reinforcing Strategic Reasoning of LLMs in Multi-Agent Games
di: He, Yidong, et al.
Pubblicazione: (2026)
di: He, Yidong, et al.
Pubblicazione: (2026)
An Investigation of Neuron Activation as a Unified Lens to Explain Chain-of-Thought Eliciting Arithmetic Reasoning of LLMs
di: Rai, Daking, et al.
Pubblicazione: (2024)
di: Rai, Daking, et al.
Pubblicazione: (2024)
Mathematical Reasoning for Unmanned Aerial Vehicles: A RAG-Based Approach for Complex Arithmetic Reasoning
di: Azarafza, Mehdi, et al.
Pubblicazione: (2025)
di: Azarafza, Mehdi, et al.
Pubblicazione: (2025)
MARSHAL: Incentivizing Multi-Agent Reasoning via Self-Play with Strategic LLMs
di: Yuan, Huining, et al.
Pubblicazione: (2025)
di: Yuan, Huining, et al.
Pubblicazione: (2025)
Combining LLM Semantic Reasoning with GNN Structural Modeling for Multi-View Multi-Label Feature Selection
di: Chen, Zhiqi, et al.
Pubblicazione: (2025)
di: Chen, Zhiqi, et al.
Pubblicazione: (2025)
UNO-Bench: A Unified Benchmark for Exploring the Compositional Law Between Uni-modal and Omni-modal in Omni Models
di: Chen, Chen, et al.
Pubblicazione: (2025)
di: Chen, Chen, et al.
Pubblicazione: (2025)
MMCTAgent: Multi-modal Critical Thinking Agent Framework for Complex Visual Reasoning
di: Kumar, Somnath, et al.
Pubblicazione: (2024)
di: Kumar, Somnath, et al.
Pubblicazione: (2024)
Diagnosing and Resolving Cloud Platform Instability with Multi-modal RAG LLMs
di: Wang, Yifan, et al.
Pubblicazione: (2025)
di: Wang, Yifan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Instruction-based Image Editing with Planning, Reasoning, and Generation
di: Ji, Liya, et al.
Pubblicazione: (2026) -
Multi-modal Knowledge Graph Generation with Semantics-enriched Prompts
di: Xu, Yajing, et al.
Pubblicazione: (2025) -
Tokenization Constraints in LLMs: A Study of Symbolic and Arithmetic Reasoning Limits
di: Zhang, Xiang, et al.
Pubblicazione: (2025) -
Probing Cross-modal Information Hubs in Audio-Visual LLMs
di: Jung, Jihoo, et al.
Pubblicazione: (2026) -
RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought
di: Lu, Yi, et al.
Pubblicazione: (2025)