Beyond Embeddings: The Promise of Visual Table in Visual Reasoning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhong, Yiwu, Hu, Zi-Yuan, Lyu, Michael R., Wang, Liwei |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Rethinking Chain-of-Thought Reasoning for Videos
par: Zhong, Yiwu, et autres
Publié: (2025)
par: Zhong, Yiwu, et autres
Publié: (2025)
Enhancing Temporal Modeling of Video LLMs via Time Gating
par: Hu, Zi-Yuan, et autres
Publié: (2024)
par: Hu, Zi-Yuan, et autres
Publié: (2024)
GoT-R1: Unleashing Reasoning Capability of MLLM for Visual Generation with Reinforcement Learning
par: Duan, Chengqi, et autres
Publié: (2025)
par: Duan, Chengqi, et autres
Publié: (2025)
MB-ORES: A Multi-Branch Object Reasoner for Visual Grounding in Remote Sensing
par: Radouane, Karim, et autres
Publié: (2025)
par: Radouane, Karim, et autres
Publié: (2025)
Contrastive Visual Data Augmentation
par: Zhou, Yu, et autres
Publié: (2025)
par: Zhou, Yu, et autres
Publié: (2025)
Evaluating Text-to-Visual Generation with Image-to-Text Generation
par: Lin, Zhiqiu, et autres
Publié: (2024)
par: Lin, Zhiqiu, et autres
Publié: (2024)
GenAI-Bench: Evaluating and Improving Compositional Text-to-Visual Generation
par: Li, Baiqi, et autres
Publié: (2024)
par: Li, Baiqi, et autres
Publié: (2024)
HaloQuest: A Visual Hallucination Dataset for Advancing Multimodal Reasoning
par: Wang, Zhecan, et autres
Publié: (2024)
par: Wang, Zhecan, et autres
Publié: (2024)
OLKAVS: An Open Large-Scale Korean Audio-Visual Speech Dataset
par: Park, Jeongkyun, et autres
Publié: (2023)
par: Park, Jeongkyun, et autres
Publié: (2023)
Seeing Culture: A Benchmark for Visual Reasoning and Grounding
par: Satar, Burak, et autres
Publié: (2025)
par: Satar, Burak, et autres
Publié: (2025)
Beyond the Leaderboard: Rethinking Medical Benchmarks for Large Language Models
par: Chen, Wenting, et autres
Publié: (2025)
par: Chen, Wenting, et autres
Publié: (2025)
HoloLLM: Multisensory Foundation Model for Language-Grounded Human Sensing and Reasoning
par: Zhou, Chuhao, et autres
Publié: (2025)
par: Zhou, Chuhao, et autres
Publié: (2025)
Seeing Beyond Words: Self-Supervised Visual Learning for Multimodal Large Language Models
par: Caffagni, Davide, et autres
Publié: (2025)
par: Caffagni, Davide, et autres
Publié: (2025)
ReAG: Reasoning-Augmented Generation for Knowledge-based Visual Question Answering
par: Compagnoni, Alberto, et autres
Publié: (2025)
par: Compagnoni, Alberto, et autres
Publié: (2025)
Improving Visual Representation Alignment Generation with GRPO
par: Mo, Shentong, et autres
Publié: (2026)
par: Mo, Shentong, et autres
Publié: (2026)
OmniEvalKit: A Modular, Lightweight Toolbox for Evaluating Large Language Model and its Omni-Extensions
par: Zhang, Yi-Kai, et autres
Publié: (2024)
par: Zhang, Yi-Kai, et autres
Publié: (2024)
ZJUKLAB at SemEval-2025 Task 4: Unlearning via Model Merging
par: Xu, Haoming, et autres
Publié: (2025)
par: Xu, Haoming, et autres
Publié: (2025)
Multi-level Mixture of Experts for Multimodal Entity Linking
par: Hu, Zhiwei, et autres
Publié: (2025)
par: Hu, Zhiwei, et autres
Publié: (2025)
Progressive Confident Masking Attention Network for Audio-Visual Segmentation
par: Wang, Yuxuan, et autres
Publié: (2024)
par: Wang, Yuxuan, et autres
Publié: (2024)
VCap: Hypergeometric Rewards for Weak-to-Strong Visual Captioning
par: Lu, Xingyu, et autres
Publié: (2026)
par: Lu, Xingyu, et autres
Publié: (2026)
LookAhead Tuning: Safer Language Models via Partial Answer Previews
par: Liu, Kangwei, et autres
Publié: (2025)
par: Liu, Kangwei, et autres
Publié: (2025)
LLaVA-MORE: A Comparative Study of LLMs and Visual Backbones for Enhanced Visual Instruction Tuning
par: Cocchi, Federico, et autres
Publié: (2025)
par: Cocchi, Federico, et autres
Publié: (2025)
LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention
par: Zhang, Renrui, et autres
Publié: (2023)
par: Zhang, Renrui, et autres
Publié: (2023)
OmniGAIA: Towards Native Omni-Modal AI Agents
par: Li, Xiaoxi, et autres
Publié: (2026)
par: Li, Xiaoxi, et autres
Publié: (2026)
MoDA: Modulation Adapter for Fine-Grained Visual Grounding in Instructional MLLMs
par: Barrios, Wayner, et autres
Publié: (2025)
par: Barrios, Wayner, et autres
Publié: (2025)
Neuron Abandoning Attention Flow: Visual Explanation of Dynamics inside CNN Models
par: Liao, Yi, et autres
Publié: (2024)
par: Liao, Yi, et autres
Publié: (2024)
PAND: Prompt-Aware Neighborhood Distillation for Lightweight Fine-Grained Visual Classification
par: Luo, Qiuming, et autres
Publié: (2026)
par: Luo, Qiuming, et autres
Publié: (2026)
Make VLM Recognize Visual Hallucination on Cartoon Character Image with Pose Information
par: Kim, Bumsoo, et autres
Publié: (2024)
par: Kim, Bumsoo, et autres
Publié: (2024)
Hear Me, See Me, Understand Me: Audio-Visual Autism Behavior Recognition
par: Deng, Shijian, et autres
Publié: (2024)
par: Deng, Shijian, et autres
Publié: (2024)
CVSearch: Empowering Multimodal LLMs with Cognitive Visual Search for High-Resolution Image Perception
par: Li, Liupeng, et autres
Publié: (2026)
par: Li, Liupeng, et autres
Publié: (2026)
Learning to See Before Seeing: Demystifying LLM Visual Priors from Language Pre-training
par: Han, Junlin, et autres
Publié: (2025)
par: Han, Junlin, et autres
Publié: (2025)
Generative AI for Character Animation: A Comprehensive Survey of Techniques, Applications, and Future Directions
par: Abootorabi, Mohammad Mahdi, et autres
Publié: (2025)
par: Abootorabi, Mohammad Mahdi, et autres
Publié: (2025)
Evaluating Semantic Variation in Text-to-Image Synthesis: A Causal Perspective
par: Zhu, Xiangru, et autres
Publié: (2024)
par: Zhu, Xiangru, et autres
Publié: (2024)
ADS-Edit: A Multimodal Knowledge Editing Dataset for Autonomous Driving Systems
par: Wang, Chenxi, et autres
Publié: (2025)
par: Wang, Chenxi, et autres
Publié: (2025)
WorDepth: Variational Language Prior for Monocular Depth Estimation
par: Zeng, Ziyao, et autres
Publié: (2024)
par: Zeng, Ziyao, et autres
Publié: (2024)
State Space Model for New-Generation Network Alternative to Transformers: A Survey
par: Wang, Xiao, et autres
Publié: (2024)
par: Wang, Xiao, et autres
Publié: (2024)
Foundations of Multisensory Artificial Intelligence
par: Liang, Paul Pu
Publié: (2024)
par: Liang, Paul Pu
Publié: (2024)
To Forget or Not? Towards Practical Knowledge Unlearning for Large Language Models
par: Tian, Bozhong, et autres
Publié: (2024)
par: Tian, Bozhong, et autres
Publié: (2024)
Multimodal Long Video Modeling Based on Temporal Dynamic Context
par: Hao, Haoran, et autres
Publié: (2025)
par: Hao, Haoran, et autres
Publié: (2025)
Aligning Agentic World Models via Knowledgeable Experience Learning
par: Ren, Baochang, et autres
Publié: (2026)
par: Ren, Baochang, et autres
Publié: (2026)
Documents similaires
-
Rethinking Chain-of-Thought Reasoning for Videos
par: Zhong, Yiwu, et autres
Publié: (2025) -
Enhancing Temporal Modeling of Video LLMs via Time Gating
par: Hu, Zi-Yuan, et autres
Publié: (2024) -
GoT-R1: Unleashing Reasoning Capability of MLLM for Visual Generation with Reinforcement Learning
par: Duan, Chengqi, et autres
Publié: (2025) -
MB-ORES: A Multi-Branch Object Reasoner for Visual Grounding in Remote Sensing
par: Radouane, Karim, et autres
Publié: (2025) -
Contrastive Visual Data Augmentation
par: Zhou, Yu, et autres
Publié: (2025)