OMEGA: Optimized Multimodal Position Encoding Index Derivation with Global Adaptive Scaling for Vision-Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Huang, Ruoxiang, Ma, Xindian, Kong, Rundong, Yuan, Zhen, Zhang, Peng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MODIX: A Training-Free Multimodal Information-Driven Positional Index Scaling for Vision-Language Models
por: Huang, Ruoxiang, et al.
Publicado: (2026)
por: Huang, Ruoxiang, et al.
Publicado: (2026)
Revisiting Multimodal Positional Encoding in Vision-Language Models
por: Huang, Jie, et al.
Publicado: (2025)
por: Huang, Jie, et al.
Publicado: (2025)
ID-LoRA: Efficient Low-Rank Adaptation Inspired by Matrix Interpolative Decomposition
por: Ma, Xindian, et al.
Publicado: (2026)
por: Ma, Xindian, et al.
Publicado: (2026)
Thinking in Blender: Staged Executable Inverse Graphics with Vision-Language Models
por: He, Guangzhao, et al.
Publicado: (2026)
por: He, Guangzhao, et al.
Publicado: (2026)
V2PE: Improving Multimodal Long-Context Capability of Vision-Language Models with Variable Visual Position Encoding
por: Ge, Junqi, et al.
Publicado: (2024)
por: Ge, Junqi, et al.
Publicado: (2024)
Accelerating Video Generation Inference with Sequential-Parallel 3D Positional Encoding Using a Global Time Index
por: Yuan, Chao, et al.
Publicado: (2026)
por: Yuan, Chao, et al.
Publicado: (2026)
Hierarchical Refinement of Universal Multimodal Attacks on Vision-Language Models
por: Zhang, Peng-Fei, et al.
Publicado: (2026)
por: Zhang, Peng-Fei, et al.
Publicado: (2026)
Positional Encoding Field
por: Bai, Yunpeng, et al.
Publicado: (2025)
por: Bai, Yunpeng, et al.
Publicado: (2025)
DAE-Fuse: An Adaptive Discriminative Autoencoder for Multi-Modality Image Fusion
por: Guo, Yuchen, et al.
Publicado: (2024)
por: Guo, Yuchen, et al.
Publicado: (2024)
An Investigation on The Position Encoding in Vision-Based Dynamics Prediction
por: Zhu, Jiageng, et al.
Publicado: (2024)
por: Zhu, Jiageng, et al.
Publicado: (2024)
LLaVAShield: Safeguarding Multimodal Multi-Turn Dialogues in Vision-Language Models
por: Huang, Guolei, et al.
Publicado: (2025)
por: Huang, Guolei, et al.
Publicado: (2025)
ProVision: Programmatically Scaling Vision-centric Instruction Data for Multimodal Language Models
por: Zhang, Jieyu, et al.
Publicado: (2024)
por: Zhang, Jieyu, et al.
Publicado: (2024)
Weierstrass Positional Encoding for Vision Transformers
por: Xin, Zhihang, et al.
Publicado: (2026)
por: Xin, Zhihang, et al.
Publicado: (2026)
CLoVe: Encoding Compositional Language in Contrastive Vision-Language Models
por: Castro, Santiago, et al.
Publicado: (2024)
por: Castro, Santiago, et al.
Publicado: (2024)
A 2D Semantic-Aware Position Encoding for Vision Transformers
por: Chen, Xi, et al.
Publicado: (2025)
por: Chen, Xi, et al.
Publicado: (2025)
AMMKD: Adaptive Multimodal Multi-teacher Distillation for Lightweight Vision-Language Models
por: Li, Yuqi, et al.
Publicado: (2025)
por: Li, Yuqi, et al.
Publicado: (2025)
PD-APE: A Parallel Decoding Framework with Adaptive Position Encoding for 3D Visual Grounding
por: Hou, Chenshu, et al.
Publicado: (2024)
por: Hou, Chenshu, et al.
Publicado: (2024)
Multi-View Large Reconstruction Model via Geometry-Aware Positional Encoding and Attention
por: Li, Mengfei, et al.
Publicado: (2024)
por: Li, Mengfei, et al.
Publicado: (2024)
Human-inspired Global-to-Parallel Multi-scale Encoding for Lightweight Vision Models
por: Xu, Wei
Publicado: (2026)
por: Xu, Wei
Publicado: (2026)
Advancing General Multimodal Capability of Vision-language Models with Pyramid-descent Visual Position Encoding
por: Chen, Zhanpeng, et al.
Publicado: (2025)
por: Chen, Zhanpeng, et al.
Publicado: (2025)
ChatEarthNet: A Global-Scale Image-Text Dataset Empowering Vision-Language Geo-Foundation Models
por: Yuan, Zhenghang, et al.
Publicado: (2024)
por: Yuan, Zhenghang, et al.
Publicado: (2024)
Do Pre-trained Vision-Language Models Encode Object States?
por: Newman, Kaleb, et al.
Publicado: (2024)
por: Newman, Kaleb, et al.
Publicado: (2024)
MFC-Bench: Benchmarking Multimodal Fact-Checking with Large Vision-Language Models
por: Wang, Shengkang, et al.
Publicado: (2024)
por: Wang, Shengkang, et al.
Publicado: (2024)
Vision-Driven Prompt Optimization for Large Language Models in Multimodal Generative Tasks
por: Franklin, Leo, et al.
Publicado: (2025)
por: Franklin, Leo, et al.
Publicado: (2025)
GPO-V: Jailbreak Diffusion Vision Language Model by Global Probability Optimization
por: Pan, Yu, et al.
Publicado: (2026)
por: Pan, Yu, et al.
Publicado: (2026)
Head-wise Adaptive Rotary Positional Encoding for Fine-Grained Image Generation
por: Li, Jiaye, et al.
Publicado: (2025)
por: Li, Jiaye, et al.
Publicado: (2025)
Data Adaptive Traceback for Vision-Language Foundation Models in Image Classification
por: Peng, Wenshuo, et al.
Publicado: (2024)
por: Peng, Wenshuo, et al.
Publicado: (2024)
PPE: Positional Preservation Embedding for Token Compression in Multimodal Large Language Models
por: Huang, Mouxiao, et al.
Publicado: (2025)
por: Huang, Mouxiao, et al.
Publicado: (2025)
Vision-Centric Activation and Coordination for Multimodal Large Language Models
por: Wang, Yunnan, et al.
Publicado: (2025)
por: Wang, Yunnan, et al.
Publicado: (2025)
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment
por: Yan, Ziang, et al.
Publicado: (2024)
por: Yan, Ziang, et al.
Publicado: (2024)
Cameras as Relative Positional Encoding
por: Li, Ruilong, et al.
Publicado: (2025)
por: Li, Ruilong, et al.
Publicado: (2025)
Skip-Vision: Efficient and Scalable Acceleration of Vision-Language Models via Adaptive Token Skipping
por: Zeng, Weili, et al.
Publicado: (2025)
por: Zeng, Weili, et al.
Publicado: (2025)
Parabolic Position Encoding: Vision-Centric, Principled, Extrapolatable, General
por: Øhrstrøm, Christoffer Koo, et al.
Publicado: (2026)
por: Øhrstrøm, Christoffer Koo, et al.
Publicado: (2026)
RedDiffuser: Auditing Multimodal Safety Failures in Vision-Language Models via Reinforced Diffusion
por: Wang, Ruofan, et al.
Publicado: (2025)
por: Wang, Ruofan, et al.
Publicado: (2025)
OMEGA-Avatar: One-shot Modeling of 360° Gaussian Avatars
por: Xia, Zehao, et al.
Publicado: (2026)
por: Xia, Zehao, et al.
Publicado: (2026)
PEVLM: Parallel Encoding for Vision-Language Models
por: Kang, Letian, et al.
Publicado: (2025)
por: Kang, Letian, et al.
Publicado: (2025)
PISA-Bench: The PISA Index as a Multilingual and Multimodal Metric for the Evaluation of Vision-Language Models
por: Haller, Patrick, et al.
Publicado: (2025)
por: Haller, Patrick, et al.
Publicado: (2025)
Valley2: Exploring Multimodal Models with Scalable Vision-Language Design
por: Wu, Ziheng, et al.
Publicado: (2025)
por: Wu, Ziheng, et al.
Publicado: (2025)
SD-VLM: Spatial Measuring and Understanding with Depth-Encoded Vision-Language Models
por: Chen, Pingyi, et al.
Publicado: (2025)
por: Chen, Pingyi, et al.
Publicado: (2025)
Uncovering Brain-Like Hierarchical Patterns in Vision-Language Models through fMRI-Based Neural Encoding
por: Ren, Yudan, et al.
Publicado: (2025)
por: Ren, Yudan, et al.
Publicado: (2025)
Ejemplares similares
-
MODIX: A Training-Free Multimodal Information-Driven Positional Index Scaling for Vision-Language Models
por: Huang, Ruoxiang, et al.
Publicado: (2026) -
Revisiting Multimodal Positional Encoding in Vision-Language Models
por: Huang, Jie, et al.
Publicado: (2025) -
ID-LoRA: Efficient Low-Rank Adaptation Inspired by Matrix Interpolative Decomposition
por: Ma, Xindian, et al.
Publicado: (2026) -
Thinking in Blender: Staged Executable Inverse Graphics with Vision-Language Models
por: He, Guangzhao, et al.
Publicado: (2026) -
V2PE: Improving Multimodal Long-Context Capability of Vision-Language Models with Variable Visual Position Encoding
por: Ge, Junqi, et al.
Publicado: (2024)