Enregistré dans:
| Auteurs principaux: | Gu, Chao, Lin, Ke, Luo, Yiyang, Hou, Jiahui, Li, Xiang-Yang |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2409.00909 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ViPO: Visual Preference Optimization at Scale
par: Li, Ming, et autres
Publié: (2026)
par: Li, Ming, et autres
Publié: (2026)
ShadowDraw: From Any Object to Shadow-Drawing Compositional Art
par: Luo, Rundong, et autres
Publié: (2025)
par: Luo, Rundong, et autres
Publié: (2025)
ViGoR-Bench: How Far Are Visual Generative Models From Zero-Shot Visual Reasoners?
par: Han, Haonan, et autres
Publié: (2026)
par: Han, Haonan, et autres
Publié: (2026)
Natural Language Supervision for Low-light Image Enhancement
par: Tang, Jiahui, et autres
Publié: (2025)
par: Tang, Jiahui, et autres
Publié: (2025)
ViP$^2$-CLIP: Visual-Perception Prompting with Unified Alignment for Zero-Shot Anomaly Detection
par: Yang, Ziteng, et autres
Publié: (2025)
par: Yang, Ziteng, et autres
Publié: (2025)
VS-LLM: Visual-Semantic Depression Assessment based on LLM for Drawing Projection Test
par: Wu, Meiqi, et autres
Publié: (2025)
par: Wu, Meiqi, et autres
Publié: (2025)
Fine-Tuning Vision-Language Model for Automated Engineering Drawing Information Extraction
par: Khan, Muhammad Tayyab, et autres
Publié: (2024)
par: Khan, Muhammad Tayyab, et autres
Publié: (2024)
Navigating Efficiency in MobileViT through Gaussian Process on Global Architecture Factors
par: Meng, Ke, et autres
Publié: (2024)
par: Meng, Ke, et autres
Publié: (2024)
CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning
par: Li, Kailing, et autres
Publié: (2025)
par: Li, Kailing, et autres
Publié: (2025)
LaViT: Aligning Latent Visual Thoughts for Multi-modal Reasoning
par: Wu, Linquan, et autres
Publié: (2026)
par: Wu, Linquan, et autres
Publié: (2026)
Reinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual Drawing
par: Wu, Junfei, et autres
Publié: (2025)
par: Wu, Junfei, et autres
Publié: (2025)
Correcting Visual Blur Induced by Attention Distraction to Reduce Hallucinations: Algorithm and Theory
par: Li, Quanjiang, et autres
Publié: (2026)
par: Li, Quanjiang, et autres
Publié: (2026)
3DrawAgent: Teaching LLM to Draw in 3D with Early Contrastive Experience
par: Xiao, Hongcan, et autres
Publié: (2026)
par: Xiao, Hongcan, et autres
Publié: (2026)
ViPER: Empowering the Self-Evolution of Visual Perception Abilities in Vision-Language Model
par: Zhang, Juntian, et autres
Publié: (2025)
par: Zhang, Juntian, et autres
Publié: (2025)
Predictive Reasoning with Augmented Anomaly Contrastive Learning for Compositional Visual Relations
par: Li, Chengtai, et autres
Publié: (2026)
par: Li, Chengtai, et autres
Publié: (2026)
SFMViT: SlowFast Meet ViT in Chaotic World
par: Lin, Jiaying, et autres
Publié: (2024)
par: Lin, Jiaying, et autres
Publié: (2024)
ViSA-Enhanced Aerial VLN: A Visual-Spatial Reasoning Enhanced Framework for Aerial Vision-Language Navigation
par: Tong, Haoyu, et autres
Publié: (2026)
par: Tong, Haoyu, et autres
Publié: (2026)
Flexible ViG: Learning the Self-Saliency for Flexible Object Recognition
par: Zuo, Lin, et autres
Publié: (2024)
par: Zuo, Lin, et autres
Publié: (2024)
From Drawings to Decisions: A Hybrid Vision-Language Framework for Parsing 2D Engineering Drawings into Structured Manufacturing Knowledge
par: Khan, Muhammad Tayyab, et autres
Publié: (2025)
par: Khan, Muhammad Tayyab, et autres
Publié: (2025)
ViG: Linear-complexity Visual Sequence Learning with Gated Linear Attention
par: Liao, Bencheng, et autres
Publié: (2024)
par: Liao, Bencheng, et autres
Publié: (2024)
ViGoR: Improving Visual Grounding of Large Vision Language Models with Fine-Grained Reward Modeling
par: Yan, Siming, et autres
Publié: (2024)
par: Yan, Siming, et autres
Publié: (2024)
Automated Parsing of Engineering Drawings for Structured Information Extraction Using a Fine-tuned Document Understanding Transformer
par: Khan, Muhammad Tayyab, et autres
Publié: (2025)
par: Khan, Muhammad Tayyab, et autres
Publié: (2025)
Text-Enhanced Panoptic Symbol Spotting in CAD Drawings
par: Liu, Xianlin, et autres
Publié: (2025)
par: Liu, Xianlin, et autres
Publié: (2025)
Context-Aware Indoor Point Cloud Object Generation through User Instructions
par: Luo, Yiyang, et autres
Publié: (2023)
par: Luo, Yiyang, et autres
Publié: (2023)
Neural Proteomics Fields for Super-resolved Spatial Proteomics Prediction
par: Zhao, Bokai, et autres
Publié: (2025)
par: Zhao, Bokai, et autres
Publié: (2025)
Video-RAG: Visually-aligned Retrieval-Augmented Long Video Comprehension
par: Luo, Yongdong, et autres
Publié: (2024)
par: Luo, Yongdong, et autres
Publié: (2024)
Uni-ViGU: Towards Unified Video Generation and Understanding via A Diffusion-Based Video Generator
par: Qin, Luozheng, et autres
Publié: (2026)
par: Qin, Luozheng, et autres
Publié: (2026)
Geo-LLaVA: A Large Multi-Modal Model for Solving Geometry Math Problems with Meta In-Context Learning
par: Xu, Shihao, et autres
Publié: (2024)
par: Xu, Shihao, et autres
Publié: (2024)
GoViG: Goal-Conditioned Visual Navigation Instruction Generation via Multimodal Reasoning
par: Wu, Fengyi, et autres
Publié: (2025)
par: Wu, Fengyi, et autres
Publié: (2025)
ViTA-PAR: Visual and Textual Attribute Alignment with Attribute Prompting for Pedestrian Attribute Recognition
par: Park, Minjeong, et autres
Publié: (2025)
par: Park, Minjeong, et autres
Publié: (2025)
ViFP: A Framework for Visual False Positive Detection to Enhance Reasoning Reliability in VLMs
par: Zhang, Ben, et autres
Publié: (2025)
par: Zhang, Ben, et autres
Publié: (2025)
LaViC: Adapting Large Vision-Language Models to Visually-Aware Conversational Recommendation
par: Jeon, Hyunsik, et autres
Publié: (2025)
par: Jeon, Hyunsik, et autres
Publié: (2025)
Frequency-Dynamic Attention Modulation for Dense Prediction
par: Chen, Linwei, et autres
Publié: (2025)
par: Chen, Linwei, et autres
Publié: (2025)
ViTok-v2: Scaling Native Resolution Auto-Encoders to 5 Billion Parameters
par: Hansen-Estruch, Philippe, et autres
Publié: (2026)
par: Hansen-Estruch, Philippe, et autres
Publié: (2026)
Frequency Dynamic Convolution for Dense Image Prediction
par: Chen, Linwei, et autres
Publié: (2025)
par: Chen, Linwei, et autres
Publié: (2025)
Visual Position Prompt for MLLM based Visual Grounding
par: Tang, Wei, et autres
Publié: (2025)
par: Tang, Wei, et autres
Publié: (2025)
CoViPAL: Layer-wise Contextualized Visual Token Pruning for Large Vision-Language Models
par: Tang, Zicong, et autres
Publié: (2025)
par: Tang, Zicong, et autres
Publié: (2025)
MMeViT: Multi-Modal ensemble ViT for Post-Stroke Rehabilitation Action Recognition
par: Kim, Ye-eun, et autres
Publié: (2025)
par: Kim, Ye-eun, et autres
Publié: (2025)
Mantis: A Versatile Vision-Language-Action Model with Disentangled Visual Foresight
par: Yang, Yi, et autres
Publié: (2025)
par: Yang, Yi, et autres
Publié: (2025)
VIVID-Med: LLM-Supervised Structured Pretraining for Deployable Medical ViTs
par: Wang, Xiyao, et autres
Publié: (2026)
par: Wang, Xiyao, et autres
Publié: (2026)
Documents similaires
-
ViPO: Visual Preference Optimization at Scale
par: Li, Ming, et autres
Publié: (2026) -
ShadowDraw: From Any Object to Shadow-Drawing Compositional Art
par: Luo, Rundong, et autres
Publié: (2025) -
ViGoR-Bench: How Far Are Visual Generative Models From Zero-Shot Visual Reasoners?
par: Han, Haonan, et autres
Publié: (2026) -
Natural Language Supervision for Low-light Image Enhancement
par: Tang, Jiahui, et autres
Publié: (2025) -
ViP$^2$-CLIP: Visual-Perception Prompting with Unified Alignment for Zero-Shot Anomaly Detection
par: Yang, Ziteng, et autres
Publié: (2025)