OMEGA: Optimized Multimodal Position Encoding Index Derivation with Global Adaptive Scaling for Vision-Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Huang, Ruoxiang, Ma, Xindian, Kong, Rundong, Yuan, Zhen, Zhang, Peng |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MODIX: A Training-Free Multimodal Information-Driven Positional Index Scaling for Vision-Language Models
par: Huang, Ruoxiang, et autres
Publié: (2026)
par: Huang, Ruoxiang, et autres
Publié: (2026)
Revisiting Multimodal Positional Encoding in Vision-Language Models
par: Huang, Jie, et autres
Publié: (2025)
par: Huang, Jie, et autres
Publié: (2025)
ID-LoRA: Efficient Low-Rank Adaptation Inspired by Matrix Interpolative Decomposition
par: Ma, Xindian, et autres
Publié: (2026)
par: Ma, Xindian, et autres
Publié: (2026)
Thinking in Blender: Staged Executable Inverse Graphics with Vision-Language Models
par: He, Guangzhao, et autres
Publié: (2026)
par: He, Guangzhao, et autres
Publié: (2026)
V2PE: Improving Multimodal Long-Context Capability of Vision-Language Models with Variable Visual Position Encoding
par: Ge, Junqi, et autres
Publié: (2024)
par: Ge, Junqi, et autres
Publié: (2024)
Accelerating Video Generation Inference with Sequential-Parallel 3D Positional Encoding Using a Global Time Index
par: Yuan, Chao, et autres
Publié: (2026)
par: Yuan, Chao, et autres
Publié: (2026)
Hierarchical Refinement of Universal Multimodal Attacks on Vision-Language Models
par: Zhang, Peng-Fei, et autres
Publié: (2026)
par: Zhang, Peng-Fei, et autres
Publié: (2026)
Positional Encoding Field
par: Bai, Yunpeng, et autres
Publié: (2025)
par: Bai, Yunpeng, et autres
Publié: (2025)
DAE-Fuse: An Adaptive Discriminative Autoencoder for Multi-Modality Image Fusion
par: Guo, Yuchen, et autres
Publié: (2024)
par: Guo, Yuchen, et autres
Publié: (2024)
An Investigation on The Position Encoding in Vision-Based Dynamics Prediction
par: Zhu, Jiageng, et autres
Publié: (2024)
par: Zhu, Jiageng, et autres
Publié: (2024)
LLaVAShield: Safeguarding Multimodal Multi-Turn Dialogues in Vision-Language Models
par: Huang, Guolei, et autres
Publié: (2025)
par: Huang, Guolei, et autres
Publié: (2025)
ProVision: Programmatically Scaling Vision-centric Instruction Data for Multimodal Language Models
par: Zhang, Jieyu, et autres
Publié: (2024)
par: Zhang, Jieyu, et autres
Publié: (2024)
Weierstrass Positional Encoding for Vision Transformers
par: Xin, Zhihang, et autres
Publié: (2026)
par: Xin, Zhihang, et autres
Publié: (2026)
CLoVe: Encoding Compositional Language in Contrastive Vision-Language Models
par: Castro, Santiago, et autres
Publié: (2024)
par: Castro, Santiago, et autres
Publié: (2024)
A 2D Semantic-Aware Position Encoding for Vision Transformers
par: Chen, Xi, et autres
Publié: (2025)
par: Chen, Xi, et autres
Publié: (2025)
AMMKD: Adaptive Multimodal Multi-teacher Distillation for Lightweight Vision-Language Models
par: Li, Yuqi, et autres
Publié: (2025)
par: Li, Yuqi, et autres
Publié: (2025)
PD-APE: A Parallel Decoding Framework with Adaptive Position Encoding for 3D Visual Grounding
par: Hou, Chenshu, et autres
Publié: (2024)
par: Hou, Chenshu, et autres
Publié: (2024)
Multi-View Large Reconstruction Model via Geometry-Aware Positional Encoding and Attention
par: Li, Mengfei, et autres
Publié: (2024)
par: Li, Mengfei, et autres
Publié: (2024)
Human-inspired Global-to-Parallel Multi-scale Encoding for Lightweight Vision Models
par: Xu, Wei
Publié: (2026)
par: Xu, Wei
Publié: (2026)
Advancing General Multimodal Capability of Vision-language Models with Pyramid-descent Visual Position Encoding
par: Chen, Zhanpeng, et autres
Publié: (2025)
par: Chen, Zhanpeng, et autres
Publié: (2025)
ChatEarthNet: A Global-Scale Image-Text Dataset Empowering Vision-Language Geo-Foundation Models
par: Yuan, Zhenghang, et autres
Publié: (2024)
par: Yuan, Zhenghang, et autres
Publié: (2024)
Do Pre-trained Vision-Language Models Encode Object States?
par: Newman, Kaleb, et autres
Publié: (2024)
par: Newman, Kaleb, et autres
Publié: (2024)
MFC-Bench: Benchmarking Multimodal Fact-Checking with Large Vision-Language Models
par: Wang, Shengkang, et autres
Publié: (2024)
par: Wang, Shengkang, et autres
Publié: (2024)
Vision-Driven Prompt Optimization for Large Language Models in Multimodal Generative Tasks
par: Franklin, Leo, et autres
Publié: (2025)
par: Franklin, Leo, et autres
Publié: (2025)
GPO-V: Jailbreak Diffusion Vision Language Model by Global Probability Optimization
par: Pan, Yu, et autres
Publié: (2026)
par: Pan, Yu, et autres
Publié: (2026)
Head-wise Adaptive Rotary Positional Encoding for Fine-Grained Image Generation
par: Li, Jiaye, et autres
Publié: (2025)
par: Li, Jiaye, et autres
Publié: (2025)
Data Adaptive Traceback for Vision-Language Foundation Models in Image Classification
par: Peng, Wenshuo, et autres
Publié: (2024)
par: Peng, Wenshuo, et autres
Publié: (2024)
PPE: Positional Preservation Embedding for Token Compression in Multimodal Large Language Models
par: Huang, Mouxiao, et autres
Publié: (2025)
par: Huang, Mouxiao, et autres
Publié: (2025)
Vision-Centric Activation and Coordination for Multimodal Large Language Models
par: Wang, Yunnan, et autres
Publié: (2025)
par: Wang, Yunnan, et autres
Publié: (2025)
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment
par: Yan, Ziang, et autres
Publié: (2024)
par: Yan, Ziang, et autres
Publié: (2024)
Cameras as Relative Positional Encoding
par: Li, Ruilong, et autres
Publié: (2025)
par: Li, Ruilong, et autres
Publié: (2025)
Skip-Vision: Efficient and Scalable Acceleration of Vision-Language Models via Adaptive Token Skipping
par: Zeng, Weili, et autres
Publié: (2025)
par: Zeng, Weili, et autres
Publié: (2025)
Parabolic Position Encoding: Vision-Centric, Principled, Extrapolatable, General
par: Øhrstrøm, Christoffer Koo, et autres
Publié: (2026)
par: Øhrstrøm, Christoffer Koo, et autres
Publié: (2026)
RedDiffuser: Auditing Multimodal Safety Failures in Vision-Language Models via Reinforced Diffusion
par: Wang, Ruofan, et autres
Publié: (2025)
par: Wang, Ruofan, et autres
Publié: (2025)
OMEGA-Avatar: One-shot Modeling of 360° Gaussian Avatars
par: Xia, Zehao, et autres
Publié: (2026)
par: Xia, Zehao, et autres
Publié: (2026)
PEVLM: Parallel Encoding for Vision-Language Models
par: Kang, Letian, et autres
Publié: (2025)
par: Kang, Letian, et autres
Publié: (2025)
PISA-Bench: The PISA Index as a Multilingual and Multimodal Metric for the Evaluation of Vision-Language Models
par: Haller, Patrick, et autres
Publié: (2025)
par: Haller, Patrick, et autres
Publié: (2025)
Valley2: Exploring Multimodal Models with Scalable Vision-Language Design
par: Wu, Ziheng, et autres
Publié: (2025)
par: Wu, Ziheng, et autres
Publié: (2025)
SD-VLM: Spatial Measuring and Understanding with Depth-Encoded Vision-Language Models
par: Chen, Pingyi, et autres
Publié: (2025)
par: Chen, Pingyi, et autres
Publié: (2025)
Uncovering Brain-Like Hierarchical Patterns in Vision-Language Models through fMRI-Based Neural Encoding
par: Ren, Yudan, et autres
Publié: (2025)
par: Ren, Yudan, et autres
Publié: (2025)
Documents similaires
-
MODIX: A Training-Free Multimodal Information-Driven Positional Index Scaling for Vision-Language Models
par: Huang, Ruoxiang, et autres
Publié: (2026) -
Revisiting Multimodal Positional Encoding in Vision-Language Models
par: Huang, Jie, et autres
Publié: (2025) -
ID-LoRA: Efficient Low-Rank Adaptation Inspired by Matrix Interpolative Decomposition
par: Ma, Xindian, et autres
Publié: (2026) -
Thinking in Blender: Staged Executable Inverse Graphics with Vision-Language Models
par: He, Guangzhao, et autres
Publié: (2026) -
V2PE: Improving Multimodal Long-Context Capability of Vision-Language Models with Variable Visual Position Encoding
par: Ge, Junqi, et autres
Publié: (2024)