LVIC: Multi-modality segmentation by Lifting Visual Info as Cue
Fuente:
arXiv
Guardado en:
| Autores principales: | Dong, Zichao, Pang, Bowen, Huang, Xufeng, Ji, Hang, Zhan, Xin, Chen, Junbo |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MV-DETR: Multi-modality indoor object detection by Multi-View DEtecton TRansformers
por: Dong, Zichao, et al.
Publicado: (2024)
por: Dong, Zichao, et al.
Publicado: (2024)
PeP: a Point enhanced Painting method for unified point cloud tasks
por: Dong, Zichao, et al.
Publicado: (2023)
por: Dong, Zichao, et al.
Publicado: (2023)
RoPETR: Improving Temporal Camera-Only 3D Detection by Integrating Enhanced Rotary Position Embedding
por: Ji, Hang, et al.
Publicado: (2025)
por: Ji, Hang, et al.
Publicado: (2025)
Beyond First Impressions: Integrating Joint Multi-modal Cues for Comprehensive 3D Representation
por: Wang, Haowei, et al.
Publicado: (2023)
por: Wang, Haowei, et al.
Publicado: (2023)
JM3D & JM3D-LLM: Elevating 3D Understanding with Joint Multi-modal Cues
por: Ji, Jiayi, et al.
Publicado: (2023)
por: Ji, Jiayi, et al.
Publicado: (2023)
PatchCue: Enhancing Vision-Language Model Reasoning with Patch-Based Visual Cues
por: Qi, Yukun, et al.
Publicado: (2026)
por: Qi, Yukun, et al.
Publicado: (2026)
Efficient Multi-modal Large Language Models via Visual Token Grouping
por: Huang, Minbin, et al.
Publicado: (2024)
por: Huang, Minbin, et al.
Publicado: (2024)
Beyond Visual Cues: Leveraging General Semantics as Support for Few-Shot Segmentation
por: Wang, Jin, et al.
Publicado: (2025)
por: Wang, Jin, et al.
Publicado: (2025)
Enhancing Vision-Language Tracking by Effectively Converting Textual Cues into Visual Cues
por: Feng, X., et al.
Publicado: (2024)
por: Feng, X., et al.
Publicado: (2024)
Inst3D-LMM: Instance-Aware 3D Scene Understanding with Multi-modal Instruction Tuning
por: Yu, Hanxun, et al.
Publicado: (2025)
por: Yu, Hanxun, et al.
Publicado: (2025)
Multi-modal Generative AI: Multi-modal LLMs, Diffusions, and the Unification
por: Wang, Xin, et al.
Publicado: (2024)
por: Wang, Xin, et al.
Publicado: (2024)
WeatherPrompt: Multi-modality Representation Learning for All-Weather Drone Visual Geo-Localization
por: Wen, Jiahao, et al.
Publicado: (2025)
por: Wen, Jiahao, et al.
Publicado: (2025)
InfoMatch: Entropy Neural Estimation for Semi-Supervised Image Classification
por: Han, Qi, et al.
Publicado: (2024)
por: Han, Qi, et al.
Publicado: (2024)
Enhancing HOI Detection with Contextual Cues from Large Vision-Language Models
por: Zhan, Yu-Wei, et al.
Publicado: (2023)
por: Zhan, Yu-Wei, et al.
Publicado: (2023)
InfoSculpt: Sculpting the Latent Space for Generalized Category Discovery
por: Liao, Wenwen, et al.
Publicado: (2026)
por: Liao, Wenwen, et al.
Publicado: (2026)
GeoMM: On Geodesic Perspective for Multi-modal Learning
por: Mei, Shibin, et al.
Publicado: (2025)
por: Mei, Shibin, et al.
Publicado: (2025)
X-Prompt: Multi-modal Visual Prompt for Video Object Segmentation
por: Guo, Pinxue, et al.
Publicado: (2024)
por: Guo, Pinxue, et al.
Publicado: (2024)
A Coarse-to-Fine Approach to Multi-Modality 3D Occupancy Grounding
por: Shi, Zhan, et al.
Publicado: (2025)
por: Shi, Zhan, et al.
Publicado: (2025)
Enhancing Incomplete Multi-modal Brain Tumor Segmentation with Intra-modal Asymmetry and Inter-modal Dependency
por: Liu, Weide, et al.
Publicado: (2024)
por: Liu, Weide, et al.
Publicado: (2024)
Multi-Cue Adaptive Visual Token Pruning for Large Vision-Language Models
por: Luan, Bozhi, et al.
Publicado: (2025)
por: Luan, Bozhi, et al.
Publicado: (2025)
Fine-grained Context and Multi-modal Alignment for Freehand 3D Ultrasound Reconstruction
por: Yan, Zhongnuo, et al.
Publicado: (2024)
por: Yan, Zhongnuo, et al.
Publicado: (2024)
Mirror in the Model: Ad Banner Image Generation via Reflective Multi-LLM and Multi-modal Agents
por: Wang, Zhao, et al.
Publicado: (2025)
por: Wang, Zhao, et al.
Publicado: (2025)
FrontierNet: Learning Visual Cues to Explore
por: Sun, Boyang, et al.
Publicado: (2025)
por: Sun, Boyang, et al.
Publicado: (2025)
VideoXum: Cross-modal Visual and Textural Summarization of Videos
por: Lin, Jingyang, et al.
Publicado: (2023)
por: Lin, Jingyang, et al.
Publicado: (2023)
InViC: Intent-aware Visual Cues for Medical Visual Question Answering
por: Wang, Zhisong, et al.
Publicado: (2026)
por: Wang, Zhisong, et al.
Publicado: (2026)
Efficient Large Multi-modal Models via Visual Context Compression
por: Chen, Jieneng, et al.
Publicado: (2024)
por: Chen, Jieneng, et al.
Publicado: (2024)
Beyond Visual Cues: Semantic-Driven Token Filtering and Expert Routing for Anytime Person ReID
por: Li, Jiaxuan, et al.
Publicado: (2026)
por: Li, Jiaxuan, et al.
Publicado: (2026)
Oracle Bone Inscriptions Multi-modal Dataset
por: Li, Bang, et al.
Publicado: (2024)
por: Li, Bang, et al.
Publicado: (2024)
ThinkOmni: Lifting Textual Reasoning to Omni-modal Scenarios via Guidance Decoding
por: Guan, Yiran, et al.
Publicado: (2026)
por: Guan, Yiran, et al.
Publicado: (2026)
ViSTA: Visual Storytelling using Multi-modal Adapters for Text-to-Image Diffusion Models
por: Dong, Sibo, et al.
Publicado: (2025)
por: Dong, Sibo, et al.
Publicado: (2025)
LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\times$RTX 4090s
por: Wang, Xijun, et al.
Publicado: (2025)
por: Wang, Xijun, et al.
Publicado: (2025)
PhotoFramer: Multi-modal Image Composition Instruction
por: You, Zhiyuan, et al.
Publicado: (2025)
por: You, Zhiyuan, et al.
Publicado: (2025)
RBench-V: A Primary Assessment for Visual Reasoning Models with Multi-modal Outputs
por: Guo, Meng-Hao, et al.
Publicado: (2025)
por: Guo, Meng-Hao, et al.
Publicado: (2025)
Exploiting Polarized Material Cues for Robust Car Detection
por: Dong, Wen, et al.
Publicado: (2024)
por: Dong, Wen, et al.
Publicado: (2024)
Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs
por: Li, Xudong, et al.
Publicado: (2025)
por: Li, Xudong, et al.
Publicado: (2025)
Pixel-Wise Contrastive Distillation
por: Huang, Junqiang, et al.
Publicado: (2022)
por: Huang, Junqiang, et al.
Publicado: (2022)
InfoAffect: Affective Annotations of Infographics in Information Spread
por: Fu, Zihang, et al.
Publicado: (2025)
por: Fu, Zihang, et al.
Publicado: (2025)
ALOcc: Adaptive Lifting-Based 3D Semantic Occupancy and Cost Volume-Based Flow Predictions
por: Chen, Dubing, et al.
Publicado: (2024)
por: Chen, Dubing, et al.
Publicado: (2024)
InfoNorm: Mutual Information Shaping of Normals for Sparse-View Reconstruction
por: Wang, Xulong, et al.
Publicado: (2024)
por: Wang, Xulong, et al.
Publicado: (2024)
InfoSyncNet: Information Synchronization Temporal Convolutional Network for Visual Speech Recognition
por: Xue, Junxiao, et al.
Publicado: (2025)
por: Xue, Junxiao, et al.
Publicado: (2025)
Ejemplares similares
-
MV-DETR: Multi-modality indoor object detection by Multi-View DEtecton TRansformers
por: Dong, Zichao, et al.
Publicado: (2024) -
PeP: a Point enhanced Painting method for unified point cloud tasks
por: Dong, Zichao, et al.
Publicado: (2023) -
RoPETR: Improving Temporal Camera-Only 3D Detection by Integrating Enhanced Rotary Position Embedding
por: Ji, Hang, et al.
Publicado: (2025) -
Beyond First Impressions: Integrating Joint Multi-modal Cues for Comprehensive 3D Representation
por: Wang, Haowei, et al.
Publicado: (2023) -
JM3D & JM3D-LLM: Elevating 3D Understanding with Joint Multi-modal Cues
por: Ji, Jiayi, et al.
Publicado: (2023)