Unbiased Visual Reasoning with Controlled Visual Inputs
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Zhaonan, Lu, Shijie, Wang, Fei, Dineen, Jacob, Ye, Xiao, Xu, Zhikun, Liu, Siyi, Cho, Young Min, Li, Bangzheng, Chang, Daniel, Nguyen, Kenny, Yang, Qizheng, Chen, Muhao, Zhou, Ben |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ToW: Thoughts of Words Improve Reasoning in Large Language Models
por: Xu, Zhikun, et al.
Publicado: (2024)
por: Xu, Zhikun, et al.
Publicado: (2024)
VisAnalog: A Diagnostic Suite for Visual Concept Transfer on Natural Images
por: Li, Zhaonan, et al.
Publicado: (2026)
por: Li, Zhaonan, et al.
Publicado: (2026)
QA-LIGN: Aligning LLMs through Constitutionally Decomposed QA
por: Dineen, Jacob, et al.
Publicado: (2025)
por: Dineen, Jacob, et al.
Publicado: (2025)
CC-LEARN: Cohort-based Consistency Learning
por: Ye, Xiao, et al.
Publicado: (2025)
por: Ye, Xiao, et al.
Publicado: (2025)
BOW: Reinforcement Learning for Bottlenecked Next Word Prediction
por: Shen, Ming, et al.
Publicado: (2025)
por: Shen, Ming, et al.
Publicado: (2025)
Latent Visual Reasoning
por: Li, Bangzheng, et al.
Publicado: (2025)
por: Li, Bangzheng, et al.
Publicado: (2025)
Semantic-Clipping: Efficient Vision-Language Modeling with Semantic-Guidedd Visual Selection
por: Li, Bangzheng, et al.
Publicado: (2025)
por: Li, Bangzheng, et al.
Publicado: (2025)
Vocabulary Dropout for Curriculum Diversity in LLM Co-Evolution
por: Dineen, Jacob, et al.
Publicado: (2026)
por: Dineen, Jacob, et al.
Publicado: (2026)
Deceptive Semantic Shortcuts on Reasoning Chains: How Far Can Models Go without Hallucination?
por: Li, Bangzheng, et al.
Publicado: (2023)
por: Li, Bangzheng, et al.
Publicado: (2023)
Learning Adaptive Reasoning Paths for Efficient Visual Reasoning
por: Huang, Yixu, et al.
Publicado: (2026)
por: Huang, Yixu, et al.
Publicado: (2026)
FamiCom: Further Demystifying Prompts for Language Models with Task-Agnostic Performance Estimation
por: Li, Bangzheng, et al.
Publicado: (2024)
por: Li, Bangzheng, et al.
Publicado: (2024)
Evaluating Medical LLMs by Levels of Autonomy: A Survey Moving from Benchmarks to Applications
por: Ye, Xiao, et al.
Publicado: (2025)
por: Ye, Xiao, et al.
Publicado: (2025)
Red Teaming Language Models for Processing Contradictory Dialogues
por: Wen, Xiaofei, et al.
Publicado: (2024)
por: Wen, Xiaofei, et al.
Publicado: (2024)
ArenaBencher: Automatic Benchmark Evolution via Multi-Model Competitive Evaluation
por: Liu, Qin, et al.
Publicado: (2025)
por: Liu, Qin, et al.
Publicado: (2025)
Can Visual Input Be Compressed? A Visual Token Compression Benchmark for Large Multimodal Models
por: Peng, Tianfan, et al.
Publicado: (2025)
por: Peng, Tianfan, et al.
Publicado: (2025)
Diagnosing and Mitigating Modality Interference in Multimodal Large Language Models
por: Cai, Rui, et al.
Publicado: (2025)
por: Cai, Rui, et al.
Publicado: (2025)
Reasoning as Representation: Rethinking Visual Reinforcement Learning in Image Quality Assessment
por: Zhao, Shijie, et al.
Publicado: (2025)
por: Zhao, Shijie, et al.
Publicado: (2025)
Conceptual and Unbiased Reasoning in Language Models
por: Zhou, Ben, et al.
Publicado: (2024)
por: Zhou, Ben, et al.
Publicado: (2024)
Unbiased Video Scene Graph Generation via Visual and Semantic Dual Debiasing
por: Li, Yanjun, et al.
Publicado: (2025)
por: Li, Yanjun, et al.
Publicado: (2025)
VGR: Visual Grounded Reasoning
por: Wang, Jiacong, et al.
Publicado: (2025)
por: Wang, Jiacong, et al.
Publicado: (2025)
Unbiased Object Detection Beyond Frequency with Visually Prompted Image Synthesis
por: Cai, Xinhao, et al.
Publicado: (2025)
por: Cai, Xinhao, et al.
Publicado: (2025)
Unsupervised Learning of Unbiased Visual Representations
por: Barbano, Carlo Alberto, et al.
Publicado: (2022)
por: Barbano, Carlo Alberto, et al.
Publicado: (2022)
Cognitive Overload: Jailbreaking Large Language Models with Overloaded Logical Thinking
por: Xu, Nan, et al.
Publicado: (2023)
por: Xu, Nan, et al.
Publicado: (2023)
Visual Adversarial Attacks and Defenses in the Physical World: A Survey
por: Wei, Xingxing, et al.
Publicado: (2022)
por: Wei, Xingxing, et al.
Publicado: (2022)
AQuaUI: Visual Token Reduction for GUI Agents with Adaptive Quadtrees
por: Li, Yuankai, et al.
Publicado: (2026)
por: Li, Yuankai, et al.
Publicado: (2026)
Dual Mean-Teacher: An Unbiased Semi-Supervised Framework for Audio-Visual Source Localization
por: Guo, Yuxin, et al.
Publicado: (2024)
por: Guo, Yuxin, et al.
Publicado: (2024)
IAG: Input-aware Backdoor Attack on VLM-based Visual Grounding
por: Li, Junxian, et al.
Publicado: (2025)
por: Li, Junxian, et al.
Publicado: (2025)
Affective and Dynamic Beam Search for Story Generation
por: Huang, Tenghao, et al.
Publicado: (2023)
por: Huang, Tenghao, et al.
Publicado: (2023)
Reinforced Attention Learning
por: Li, Bangzheng, et al.
Publicado: (2026)
por: Li, Bangzheng, et al.
Publicado: (2026)
FootFormer: Estimating Stability from Visual Input
por: Kraiger, Keaton, et al.
Publicado: (2025)
por: Kraiger, Keaton, et al.
Publicado: (2025)
False Sense of Security: Why Probing-based Malicious Input Detection Fails to Generalize
por: Wang, Cheng, et al.
Publicado: (2025)
por: Wang, Cheng, et al.
Publicado: (2025)
ULF-Loc: Unbiased Landmark Feature for Robust Visual Localization with 3D Gaussian Splatting
por: Gu, Yingdong, et al.
Publicado: (2026)
por: Gu, Yingdong, et al.
Publicado: (2026)
MMKU-Bench: A Multimodal Update Benchmark for Diverse Visual Knowledge
por: Fu, Baochen, et al.
Publicado: (2026)
por: Fu, Baochen, et al.
Publicado: (2026)
VIRAL: Visual In-Context Reasoning via Analogy in Diffusion Transformers
por: Li, Zhiwen, et al.
Publicado: (2026)
por: Li, Zhiwen, et al.
Publicado: (2026)
ReTrace: Interactive Visualizations for Reasoning Traces of Large Reasoning Models
por: Felder, Ludwig, et al.
Publicado: (2025)
por: Felder, Ludwig, et al.
Publicado: (2025)
Can Vision-Language Models Infer Speaker's Ignorance? The Role of Visual and Linguistic Cues
por: Cho, Ye-eun, et al.
Publicado: (2025)
por: Cho, Ye-eun, et al.
Publicado: (2025)
VisualQuest: A Benchmark for Abstract Visual Reasoning in MLLMs
por: Xiao, Kelaiti, et al.
Publicado: (2025)
por: Xiao, Kelaiti, et al.
Publicado: (2025)
BabyVision: Visual Reasoning Beyond Language
por: Chen, Liang, et al.
Publicado: (2026)
por: Chen, Liang, et al.
Publicado: (2026)
Thinking with Visual Abstract: Enhancing Multimodal Reasoning via Visual Abstraction
por: Liu, Dairu, et al.
Publicado: (2025)
por: Liu, Dairu, et al.
Publicado: (2025)
LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models
por: Chang, Tzu-Tao, et al.
Publicado: (2025)
por: Chang, Tzu-Tao, et al.
Publicado: (2025)
Ejemplares similares
-
ToW: Thoughts of Words Improve Reasoning in Large Language Models
por: Xu, Zhikun, et al.
Publicado: (2024) -
VisAnalog: A Diagnostic Suite for Visual Concept Transfer on Natural Images
por: Li, Zhaonan, et al.
Publicado: (2026) -
QA-LIGN: Aligning LLMs through Constitutionally Decomposed QA
por: Dineen, Jacob, et al.
Publicado: (2025) -
CC-LEARN: Cohort-based Consistency Learning
por: Ye, Xiao, et al.
Publicado: (2025) -
BOW: Reinforcement Learning for Bottlenecked Next Word Prediction
por: Shen, Ming, et al.
Publicado: (2025)