Multi-modal Auto-regressive Modeling via Visual Words
Fuente:
arXiv
Guardado en:
| Autores principales: | Peng, Tianshuo, Li, Zuchao, Zhang, Lefei, Zhao, Hai, Wang, Ping, Du, Bo |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
CoViPAL: Layer-wise Contextualized Visual Token Pruning for Large Vision-Language Models
por: Tang, Zicong, et al.
Publicado: (2025)
por: Tang, Zicong, et al.
Publicado: (2025)
NOTA: Multimodal Music Notation Understanding for Visual Large Language Model
por: Tang, Mingni, et al.
Publicado: (2025)
por: Tang, Mingni, et al.
Publicado: (2025)
MGIMM: Multi-Granularity Instruction Multimodal Model for Attribute-Guided Remote Sensing Image Detailed Description
por: Yang, Cong, et al.
Publicado: (2024)
por: Yang, Cong, et al.
Publicado: (2024)
Concept Visualization: Explaining the CLIP Multi-modal Embedding Using WordNet
por: Giulivi, Loris, et al.
Publicado: (2024)
por: Giulivi, Loris, et al.
Publicado: (2024)
Visual Words Meet BM25: Sparse Auto-Encoder Visual Word Scoring for Image Retrieval
por: Han, Donghoon, et al.
Publicado: (2026)
por: Han, Donghoon, et al.
Publicado: (2026)
Mitigating Visual Forgetting via Take-along Visual Conditioning for Multi-modal Long CoT Reasoning
por: Sun, Hai-Long, et al.
Publicado: (2025)
por: Sun, Hai-Long, et al.
Publicado: (2025)
TGC-Net: A Structure-Aware and Semantically-Aligned Framework for Text-Guided Medical Image Segmentation
por: Lin, Gaoren, et al.
Publicado: (2025)
por: Lin, Gaoren, et al.
Publicado: (2025)
Centroid-centered Modeling for Efficient Vision Transformer Pre-training
por: Yan, Xin, et al.
Publicado: (2023)
por: Yan, Xin, et al.
Publicado: (2023)
Open-MAGVIT2: An Open-Source Project Toward Democratizing Auto-regressive Visual Generation
por: Luo, Zhuoyan, et al.
Publicado: (2024)
por: Luo, Zhuoyan, et al.
Publicado: (2024)
Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation
por: Xu, Zhiyang, et al.
Publicado: (2025)
por: Xu, Zhiyang, et al.
Publicado: (2025)
Auto-regressive transformation for image alignment
por: Lee, Kanggeon, et al.
Publicado: (2025)
por: Lee, Kanggeon, et al.
Publicado: (2025)
AUVIC: Adversarial Unlearning of Visual Concepts for Multi-modal Large Language Models
por: Chen, Haokun, et al.
Publicado: (2025)
por: Chen, Haokun, et al.
Publicado: (2025)
Segment First or Comprehend First? Explore the Limit of Unsupervised Word Segmentation with Large Language Models
por: Zhang, Zihong, et al.
Publicado: (2025)
por: Zhang, Zihong, et al.
Publicado: (2025)
RSVP: Reasoning Segmentation via Visual Prompting and Multi-modal Chain-of-Thought
por: Lu, Yi, et al.
Publicado: (2025)
por: Lu, Yi, et al.
Publicado: (2025)
Multi-Modality Distillation via Learning the teacher's modality-level Gram Matrix
por: Liu, Peng
Publicado: (2021)
por: Liu, Peng
Publicado: (2021)
Diffree: Text-Guided Shape Free Object Inpainting with Diffusion Model
por: Zhao, Lirui, et al.
Publicado: (2024)
por: Zhao, Lirui, et al.
Publicado: (2024)
Awesome Multi-modal Object Tracking
por: Zhang, Chunhui, et al.
Publicado: (2024)
por: Zhang, Chunhui, et al.
Publicado: (2024)
MultiEmo-Bench: Multi-label Visual Emotion Analysis for Multi-modal Large Language Models
por: Chen, Tianwei, et al.
Publicado: (2026)
por: Chen, Tianwei, et al.
Publicado: (2026)
Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation
por: Yue, Junrong, et al.
Publicado: (2025)
por: Yue, Junrong, et al.
Publicado: (2025)
ZipAR: Parallel Auto-regressive Image Generation through Spatial Locality
por: He, Yefei, et al.
Publicado: (2024)
por: He, Yefei, et al.
Publicado: (2024)
LLMTrack: Semantic Multi-Object Tracking with Multi-modal Large Language Models
por: Liao, Pan, et al.
Publicado: (2026)
por: Liao, Pan, et al.
Publicado: (2026)
FakeShield: Explainable Image Forgery Detection and Localization via Multi-modal Large Language Models
por: Xu, Zhipei, et al.
Publicado: (2024)
por: Xu, Zhipei, et al.
Publicado: (2024)
LaViT: Aligning Latent Visual Thoughts for Multi-modal Reasoning
por: Wu, Linquan, et al.
Publicado: (2026)
por: Wu, Linquan, et al.
Publicado: (2026)
PTQ4ARVG: Post-Training Quantization for AutoRegressive Visual Generation Models
por: Liu, Xuewen, et al.
Publicado: (2026)
por: Liu, Xuewen, et al.
Publicado: (2026)
Fine-R1: Make Multi-modal LLMs Excel in Fine-Grained Visual Recognition by Chain-of-Thought Reasoning
por: He, Hulingxiao, et al.
Publicado: (2026)
por: He, Hulingxiao, et al.
Publicado: (2026)
CognitionCapturerPro: Towards High-Fidelity Visual Decoding from EEG/MEG via Multi-modal Information and Asymmetric Alignment
por: Zhang, Kaifan, et al.
Publicado: (2026)
por: Zhang, Kaifan, et al.
Publicado: (2026)
Visual Hallucinations of Multi-modal Large Language Models
por: Huang, Wen, et al.
Publicado: (2024)
por: Huang, Wen, et al.
Publicado: (2024)
Multi-modal Generative AI: Multi-modal LLMs, Diffusions, and the Unification
por: Wang, Xin, et al.
Publicado: (2024)
por: Wang, Xin, et al.
Publicado: (2024)
Visual Delta Generator with Large Multi-modal Models for Semi-supervised Composed Image Retrieval
por: Jang, Young Kyun, et al.
Publicado: (2024)
por: Jang, Young Kyun, et al.
Publicado: (2024)
Fine-grained Action Analysis: A Multi-modality and Multi-task Dataset of Figure Skating
por: Liu, Sheng-Lan, et al.
Publicado: (2023)
por: Liu, Sheng-Lan, et al.
Publicado: (2023)
Energy-Latency Manipulation of Multi-modal Large Language Models via Verbose Samples
por: Gao, Kuofeng, et al.
Publicado: (2024)
por: Gao, Kuofeng, et al.
Publicado: (2024)
Interactive Character Control with Auto-Regressive Motion Diffusion Models
por: Shi, Yi, et al.
Publicado: (2023)
por: Shi, Yi, et al.
Publicado: (2023)
Human Activity Recognition using RGB-Event based Sensors: A Multi-modal Heat Conduction Model and A Benchmark Dataset
por: Wang, Shiao, et al.
Publicado: (2025)
por: Wang, Shiao, et al.
Publicado: (2025)
Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech
por: Liu, Rui, et al.
Publicado: (2024)
por: Liu, Rui, et al.
Publicado: (2024)
MapFusion: A Novel BEV Feature Fusion Network for Multi-modal Map Construction
por: Hao, Xiaoshuai, et al.
Publicado: (2025)
por: Hao, Xiaoshuai, et al.
Publicado: (2025)
MIRAGE: A Multi-modal Benchmark for Spatial Perception, Reasoning, and Intelligence
por: Liu, Chonghan, et al.
Publicado: (2025)
por: Liu, Chonghan, et al.
Publicado: (2025)
TrajFlow: Multi-modal Motion Prediction via Flow Matching
por: Yan, Qi, et al.
Publicado: (2025)
por: Yan, Qi, et al.
Publicado: (2025)
Towards Scalable Foundation Model for Multi-modal and Hyperspectral Geospatial Data
por: Si, Haozhe, et al.
Publicado: (2025)
por: Si, Haozhe, et al.
Publicado: (2025)
Beyond Static Vision: Scene Dynamic Field Unlocks Intuitive Physics Understanding in Multi-modal Large Language Models
por: Li, Nanxi, et al.
Publicado: (2026)
por: Li, Nanxi, et al.
Publicado: (2026)
Multi-modal Test-time Adaptation via Adaptive Probabilistic Gaussian Calibration
por: Xu, Jinglin, et al.
Publicado: (2026)
por: Xu, Jinglin, et al.
Publicado: (2026)
Ejemplares similares
-
CoViPAL: Layer-wise Contextualized Visual Token Pruning for Large Vision-Language Models
por: Tang, Zicong, et al.
Publicado: (2025) -
NOTA: Multimodal Music Notation Understanding for Visual Large Language Model
por: Tang, Mingni, et al.
Publicado: (2025) -
MGIMM: Multi-Granularity Instruction Multimodal Model for Attribute-Guided Remote Sensing Image Detailed Description
por: Yang, Cong, et al.
Publicado: (2024) -
Concept Visualization: Explaining the CLIP Multi-modal Embedding Using WordNet
por: Giulivi, Loris, et al.
Publicado: (2024) -
Visual Words Meet BM25: Sparse Auto-Encoder Visual Word Scoring for Image Retrieval
por: Han, Donghoon, et al.
Publicado: (2026)