Optical Context Compression Is Just (Bad) Autoencoding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lee, Ivan Yee, Yang, Cheng, Berg-Kirkpatrick, Taylor |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Alt-Text with Context: Improving Accessibility for Images on Twitter
par: Srivatsan, Nikita, et autres
Publié: (2023)
par: Srivatsan, Nikita, et autres
Publié: (2023)
Are VLMs Seeing or Just Saying? Uncovering the Illusion of Visual Re-examination
par: Shi, Chufan, et autres
Publié: (2026)
par: Shi, Chufan, et autres
Publié: (2026)
Glyph: Scaling Context Windows via Visual-Text Compression
par: Cheng, Jiale, et autres
Publié: (2025)
par: Cheng, Jiale, et autres
Publié: (2025)
Do Text Edits Generalize to Visual Generation? Benchmarking Cross-Modal Knowledge Editing in UMMs
par: Gao, Xin, et autres
Publié: (2026)
par: Gao, Xin, et autres
Publié: (2026)
From Reasoning to Pixels: Benchmarking the Alignment Gap in Unified Multimodal Models
par: Yang, Cheng, et autres
Publié: (2026)
par: Yang, Cheng, et autres
Publié: (2026)
Are Hallucinations Bad Estimations?
par: Liu, Hude, et autres
Publié: (2025)
par: Liu, Hude, et autres
Publié: (2025)
Learning from Synthetic Data for Visual Grounding
par: He, Ruozhen, et autres
Publié: (2024)
par: He, Ruozhen, et autres
Publié: (2024)
A Survey on Transformer Compression
par: Tang, Yehui, et autres
Publié: (2024)
par: Tang, Yehui, et autres
Publié: (2024)
Why are Visually-Grounded Language Models Bad at Image Classification?
par: Zhang, Yuhui, et autres
Publié: (2024)
par: Zhang, Yuhui, et autres
Publié: (2024)
Context-Aware Multimodal Pretraining
par: Roth, Karsten, et autres
Publié: (2024)
par: Roth, Karsten, et autres
Publié: (2024)
Lever LM: Configuring In-Context Sequence to Lever Large Vision Language Models
par: Yang, Xu, et autres
Publié: (2023)
par: Yang, Xu, et autres
Publié: (2023)
Improving MLLM Historical Record Extraction with Test-Time Image
par: Archibald, Taylor, et autres
Publié: (2025)
par: Archibald, Taylor, et autres
Publié: (2025)
White-Box Transformers via Sparse Rate Reduction: Compression Is All There Is?
par: Yu, Yaodong, et autres
Publié: (2023)
par: Yu, Yaodong, et autres
Publié: (2023)
Just KIDDIN: Knowledge Infusion and Distillation for Detection of INdecent Memes
par: Garg, Rahul, et autres
Publié: (2024)
par: Garg, Rahul, et autres
Publié: (2024)
Readability $\ne$ Learnability: Rethinking the Role of Simplicity in Training Small Language Models
par: Lee, Ivan, et autres
Publié: (2025)
par: Lee, Ivan, et autres
Publié: (2025)
Low-Resource Heuristics for Bahnaric Optical Character Recognition Improvement
par: Tran, Phat, et autres
Publié: (2026)
par: Tran, Phat, et autres
Publié: (2026)
Let the Target Select for Itself: Data Selection via Target-Aligned Paths
par: Yang, Huitao, et autres
Publié: (2026)
par: Yang, Huitao, et autres
Publié: (2026)
Till the Layers Collapse: Compressing a Deep Neural Network through the Lenses of Batch Normalization Layers
par: Liao, Zhu, et autres
Publié: (2024)
par: Liao, Zhu, et autres
Publié: (2024)
The Cost of Context: Mitigating Textual Bias in Multimodal Retrieval-Augmented Generation
par: Jung, Hoin, et autres
Publié: (2026)
par: Jung, Hoin, et autres
Publié: (2026)
Steering LVLMs via Sparse Autoencoder for Hallucination Mitigation
par: Hua, Zhenglin, et autres
Publié: (2025)
par: Hua, Zhenglin, et autres
Publié: (2025)
Sparse Autoencoders as Plug-and-Play Firewalls for Adversarial Attack Detection in VLMs
par: Wang, Hao, et autres
Publié: (2026)
par: Wang, Hao, et autres
Publié: (2026)
ContextMRI: Enhancing Compressed Sensing MRI through Metadata Conditioning
par: Chung, Hyungjin, et autres
Publié: (2025)
par: Chung, Hyungjin, et autres
Publié: (2025)
Rethinking Genomic Modeling Through Optical Character Recognition
par: Xiang, Hongxin, et autres
Publié: (2026)
par: Xiang, Hongxin, et autres
Publié: (2026)
TempCore: Are Video QA Benchmarks Temporally Grounded? A Frame Selection Sensitivity Analysis and Benchmark
par: Ok, Hyunjong, et autres
Publié: (2025)
par: Ok, Hyunjong, et autres
Publié: (2025)
Examining the Robustness of Homogeneity Bias to Hyperparameter Adjustments in GPT-4
par: Lee, Messi H. J.
Publié: (2025)
par: Lee, Messi H. J.
Publié: (2025)
Verbalized Representation Learning for Interpretable Few-Shot Generalization
par: Yang, Cheng-Fu, et autres
Publié: (2024)
par: Yang, Cheng-Fu, et autres
Publié: (2024)
LogogramNLP: Comparing Visual and Textual Representations of Ancient Logographic Writing Systems for NLP
par: Chen, Danlu, et autres
Publié: (2024)
par: Chen, Danlu, et autres
Publié: (2024)
Thinking in Frames: How Visual Context and Test-Time Scaling Empower Video Reasoning
par: Li, Chengzu, et autres
Publié: (2026)
par: Li, Chengzu, et autres
Publié: (2026)
Fine-Grained Alignment in Vision-and-Language Navigation through Bayesian Optimization
par: Song, Yuhang, et autres
Publié: (2024)
par: Song, Yuhang, et autres
Publié: (2024)
Reinforced Attention Learning
par: Li, Bangzheng, et autres
Publié: (2026)
par: Li, Bangzheng, et autres
Publié: (2026)
TopViewRS: Vision-Language Models as Top-View Spatial Reasoners
par: Li, Chengzu, et autres
Publié: (2024)
par: Li, Chengzu, et autres
Publié: (2024)
MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts
par: Lu, Pan, et autres
Publié: (2023)
par: Lu, Pan, et autres
Publié: (2023)
Calibrated Self-Rewarding Vision Language Models
par: Zhou, Yiyang, et autres
Publié: (2024)
par: Zhou, Yiyang, et autres
Publié: (2024)
LatentLLM: Attention-Aware Joint Tensor Compression
par: Koike-Akino, Toshiaki, et autres
Publié: (2025)
par: Koike-Akino, Toshiaki, et autres
Publié: (2025)
Imagine while Reasoning in Space: Multimodal Visualization-of-Thought
par: Li, Chengzu, et autres
Publié: (2025)
par: Li, Chengzu, et autres
Publié: (2025)
Dynamic Context-oriented Decomposition for Task-aware Low-rank Adaptation with Less Forgetting and Faster Convergence
par: Yang, Yibo, et autres
Publié: (2025)
par: Yang, Yibo, et autres
Publié: (2025)
Hyperbolic Multimodal Representation Learning for Biological Taxonomies
par: Gong, ZeMing, et autres
Publié: (2025)
par: Gong, ZeMing, et autres
Publié: (2025)
VPO: Aligning Text-to-Video Generation Models with Prompt Optimization
par: Cheng, Jiale, et autres
Publié: (2025)
par: Cheng, Jiale, et autres
Publié: (2025)
11Plus-Bench: Demystifying Multimodal LLM Spatial Reasoning with Cognitive-Inspired Analysis
par: Li, Chengzu, et autres
Publié: (2025)
par: Li, Chengzu, et autres
Publié: (2025)
Generative Technology for Human Emotion Recognition: A Scope Review
par: Ma, Fei, et autres
Publié: (2024)
par: Ma, Fei, et autres
Publié: (2024)
Documents similaires
-
Alt-Text with Context: Improving Accessibility for Images on Twitter
par: Srivatsan, Nikita, et autres
Publié: (2023) -
Are VLMs Seeing or Just Saying? Uncovering the Illusion of Visual Re-examination
par: Shi, Chufan, et autres
Publié: (2026) -
Glyph: Scaling Context Windows via Visual-Text Compression
par: Cheng, Jiale, et autres
Publié: (2025) -
Do Text Edits Generalize to Visual Generation? Benchmarking Cross-Modal Knowledge Editing in UMMs
par: Gao, Xin, et autres
Publié: (2026) -
From Reasoning to Pixels: Benchmarking the Alignment Gap in Unified Multimodal Models
par: Yang, Cheng, et autres
Publié: (2026)