VAEER: Visual Attention-Inspired Emotion Elicitation Reasoning
Fuente:
arXiv
Guardado en:
| Autores principales: | Man, Fanhang, Chen, Xiaoyue, Wang, Huandong, Zhao, Baining, Li, Han, Chen, Xinlei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Embodied-R: Collaborative Framework for Activating Embodied Spatial Reasoning in Foundation Models via Reinforcement Learning
por: Zhao, Baining, et al.
Publicado: (2025)
por: Zhao, Baining, et al.
Publicado: (2025)
Context-Aware Sentiment Forecasting via LLM-based Multi-Perspective Role-Playing Agents
por: Man, Fanhang, et al.
Publicado: (2025)
por: Man, Fanhang, et al.
Publicado: (2025)
Progressive Supernet Training for Efficient Visual Autoregressive Modeling
por: Chen, Xiaoyue, et al.
Publicado: (2025)
por: Chen, Xiaoyue, et al.
Publicado: (2025)
Latent Sketchpad: Sketching Visual Thoughts to Elicit Multimodal Reasoning in MLLMs
por: Zhang, Huanyu, et al.
Publicado: (2025)
por: Zhang, Huanyu, et al.
Publicado: (2025)
MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale
por: Guo, Jarvis, et al.
Publicado: (2024)
por: Guo, Jarvis, et al.
Publicado: (2024)
Faithful-MR1: Faithful Multimodal Reasoning via Anchoring and Reinforcing Visual Attention
por: Tian, Changyuan, et al.
Publicado: (2026)
por: Tian, Changyuan, et al.
Publicado: (2026)
Sparkle: Mastering Basic Spatial Capabilities in Vision Language Models Elicits Generalization to Spatial Reasoning
por: Tang, Yihong, et al.
Publicado: (2024)
por: Tang, Yihong, et al.
Publicado: (2024)
Latent Visual Reasoning
por: Li, Bangzheng, et al.
Publicado: (2025)
por: Li, Bangzheng, et al.
Publicado: (2025)
Integrating Fine-Grained Audio-Visual Evidence for Robust Multimodal Emotion Reasoning
por: Zhao, Zhixian, et al.
Publicado: (2026)
por: Zhao, Zhixian, et al.
Publicado: (2026)
Learning Adaptive Reasoning Paths for Efficient Visual Reasoning
por: Huang, Yixu, et al.
Publicado: (2026)
por: Huang, Yixu, et al.
Publicado: (2026)
Reasoning Paths with Reference Objects Elicit Quantitative Spatial Reasoning in Large Vision-Language Models
por: Liao, Yuan-Hong, et al.
Publicado: (2024)
por: Liao, Yuan-Hong, et al.
Publicado: (2024)
TriAttention: Efficient Long Reasoning with Trigonometric KV Compression
por: Mao, Weian, et al.
Publicado: (2026)
por: Mao, Weian, et al.
Publicado: (2026)
VisualPRM: An Effective Process Reward Model for Multimodal Reasoning
por: Wang, Weiyun, et al.
Publicado: (2025)
por: Wang, Weiyun, et al.
Publicado: (2025)
Open Vision Reasoner: Transferring Linguistic Cognitive Behavior for Visual Reasoning
por: Wei, Yana, et al.
Publicado: (2025)
por: Wei, Yana, et al.
Publicado: (2025)
BabyVision: Visual Reasoning Beyond Language
por: Chen, Liang, et al.
Publicado: (2026)
por: Chen, Liang, et al.
Publicado: (2026)
Multi-Head Attention Driven Dynamic Visual-Semantic Embedding for Enhanced Image-Text Matching
por: Chen, Wenjing
Publicado: (2024)
por: Chen, Wenjing
Publicado: (2024)
QUIDS: Quality-informed Incentive-driven Multi-agent Dispatching System for Mobile Crowdsensing
por: Zhou, Nan, et al.
Publicado: (2025)
por: Zhou, Nan, et al.
Publicado: (2025)
UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs
por: Jiang, Houcheng, et al.
Publicado: (2026)
por: Jiang, Houcheng, et al.
Publicado: (2026)
$A^2R^2$: Advancing Img2LaTeX Conversion via Visual Reasoning with Attention-Guided Refinement
por: Li, Zhecheng, et al.
Publicado: (2025)
por: Li, Zhecheng, et al.
Publicado: (2025)
Learning GUI Grounding with Spatial Reasoning from Visual Feedback
por: Zhao, Yu, et al.
Publicado: (2025)
por: Zhao, Yu, et al.
Publicado: (2025)
CameraBench: Benchmarking Visual Reasoning in MLLMs via Photography
por: Fang, I-Sheng, et al.
Publicado: (2025)
por: Fang, I-Sheng, et al.
Publicado: (2025)
CODIS: Benchmarking Context-Dependent Visual Comprehension for Multimodal Large Language Models
por: Luo, Fuwen, et al.
Publicado: (2024)
por: Luo, Fuwen, et al.
Publicado: (2024)
What Makes for Good Visual Instructions? Synthesizing Complex Visual Reasoning Instructions for Visual Instruction Tuning
por: Du, Yifan, et al.
Publicado: (2023)
por: Du, Yifan, et al.
Publicado: (2023)
Selective Vision is the Challenge for Visual Reasoning: A Benchmark for Visual Argument Understanding
por: Chung, Jiwan, et al.
Publicado: (2024)
por: Chung, Jiwan, et al.
Publicado: (2024)
TableVista: Benchmarking Multimodal Table Reasoning under Visual and Structural Complexity
por: Yang, Zheyuan, et al.
Publicado: (2026)
por: Yang, Zheyuan, et al.
Publicado: (2026)
Embodied-Reasoner: Synergizing Visual Search, Reasoning, and Action for Embodied Interactive Tasks
por: Zhang, Wenqi, et al.
Publicado: (2025)
por: Zhang, Wenqi, et al.
Publicado: (2025)
Interleaved Latent Visual Reasoning with Selective Perceptual Modeling
por: Dong, Shuai, et al.
Publicado: (2025)
por: Dong, Shuai, et al.
Publicado: (2025)
STAIR: Spatial-Temporal Reasoning with Auditable Intermediate Results for Video Question Answering
por: Wang, Yueqian, et al.
Publicado: (2024)
por: Wang, Yueqian, et al.
Publicado: (2024)
CNVSRC 2023: The First Chinese Continuous Visual Speech Recognition Challenge
por: Chen, Chen, et al.
Publicado: (2024)
por: Chen, Chen, et al.
Publicado: (2024)
Unbiased Visual Reasoning with Controlled Visual Inputs
por: Li, Zhaonan, et al.
Publicado: (2025)
por: Li, Zhaonan, et al.
Publicado: (2025)
Hierarchical Visual Agent: Managing Contexts in Joint Image-Text Space for Advanced Chart Reasoning
por: Dong, Qihua, et al.
Publicado: (2026)
por: Dong, Qihua, et al.
Publicado: (2026)
ScanReason: Empowering 3D Visual Grounding with Reasoning Capabilities
por: Zhu, Chenming, et al.
Publicado: (2024)
por: Zhu, Chenming, et al.
Publicado: (2024)
Instruction-Aligned Visual Attention for Mitigating Hallucinations in Large Vision-Language Models
por: Li, Bin, et al.
Publicado: (2025)
por: Li, Bin, et al.
Publicado: (2025)
Render-of-Thought: Rendering Textual Chain-of-Thought as Images for Visual Latent Reasoning
por: Wang, Yifan, et al.
Publicado: (2026)
por: Wang, Yifan, et al.
Publicado: (2026)
VividMed: Vision Language Model with Versatile Visual Grounding for Medicine
por: Luo, Lingxiao, et al.
Publicado: (2024)
por: Luo, Lingxiao, et al.
Publicado: (2024)
Weak-eval-Strong: Evaluating and Eliciting Lateral Thinking of LLMs with Situation Puzzles
por: Chen, Qi, et al.
Publicado: (2024)
por: Chen, Qi, et al.
Publicado: (2024)
FSMR: A Feature Swapping Multi-modal Reasoning Approach with Joint Textual and Visual Clues
por: Li, Shuang, et al.
Publicado: (2024)
por: Li, Shuang, et al.
Publicado: (2024)
Beyond Words: Enhancing Desire, Emotion, and Sentiment Recognition with Non-Verbal Cues
por: Chen, Wei, et al.
Publicado: (2025)
por: Chen, Wei, et al.
Publicado: (2025)
Exploring the Design Space of Visual Context Representation in Video MLLMs
por: Du, Yifan, et al.
Publicado: (2024)
por: Du, Yifan, et al.
Publicado: (2024)
Benchmarking and Improving Large Vision-Language Models for Fundamental Visual Graph Understanding and Reasoning
por: Zhu, Yingjie, et al.
Publicado: (2024)
por: Zhu, Yingjie, et al.
Publicado: (2024)
Ejemplares similares
-
Embodied-R: Collaborative Framework for Activating Embodied Spatial Reasoning in Foundation Models via Reinforcement Learning
por: Zhao, Baining, et al.
Publicado: (2025) -
Context-Aware Sentiment Forecasting via LLM-based Multi-Perspective Role-Playing Agents
por: Man, Fanhang, et al.
Publicado: (2025) -
Progressive Supernet Training for Efficient Visual Autoregressive Modeling
por: Chen, Xiaoyue, et al.
Publicado: (2025) -
Latent Sketchpad: Sketching Visual Thoughts to Elicit Multimodal Reasoning in MLLMs
por: Zhang, Huanyu, et al.
Publicado: (2025) -
MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale
por: Guo, Jarvis, et al.
Publicado: (2024)