Visual Knowledge in the Big Model Era: Retrospect and Prospect
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Wenguan, Yang, Yi, Pan, Yunhe |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Towards Data-and Knowledge-Driven Artificial Intelligence: A Survey on Neuro-Symbolic Computing
por: Wang, Wenguan, et al.
Publicado: (2022)
por: Wang, Wenguan, et al.
Publicado: (2022)
The Hidden Life of Tokens: Reducing Hallucination of Large Vision-Language Models via Visual Information Steering
por: Li, Zhuowei, et al.
Publicado: (2025)
por: Li, Zhuowei, et al.
Publicado: (2025)
Revisiting Model Stitching In the Foundation Model Era
por: Mai, Zheda, et al.
Publicado: (2026)
por: Mai, Zheda, et al.
Publicado: (2026)
Anatomy-VLM: A Fine-grained Vision-Language Model for Medical Interpretation
por: Gu, Difei, et al.
Publicado: (2025)
por: Gu, Difei, et al.
Publicado: (2025)
RadAlign: Advancing Radiology Report Generation with Vision-Language Concept Alignment
por: Gu, Difei, et al.
Publicado: (2025)
por: Gu, Difei, et al.
Publicado: (2025)
VIST-GPT: Ushering in the Era of Visual Storytelling with LLMs?
por: Gado, Mohamed, et al.
Publicado: (2025)
por: Gado, Mohamed, et al.
Publicado: (2025)
Leveraging Geometric Visual Illusions as Perceptual Inductive Biases for Vision Models
por: Yang, Haobo, et al.
Publicado: (2025)
por: Yang, Haobo, et al.
Publicado: (2025)
Activation Matters: Test-time Activated Negative Labels for OOD Detection with Vision-Language Models
por: Zhang, Yabin, et al.
Publicado: (2026)
por: Zhang, Yabin, et al.
Publicado: (2026)
Generalized Out-of-Distribution Detection and Beyond in Vision Language Model Era: A Survey
por: Miyai, Atsuyuki, et al.
Publicado: (2024)
por: Miyai, Atsuyuki, et al.
Publicado: (2024)
DistilDoc: Knowledge Distillation for Visually-Rich Document Applications
por: Van Landeghem, Jordy, et al.
Publicado: (2024)
por: Van Landeghem, Jordy, et al.
Publicado: (2024)
Token Activation Map to Visually Explain Multimodal LLMs
por: Li, Yi, et al.
Publicado: (2025)
por: Li, Yi, et al.
Publicado: (2025)
Chart-FR1: Visual Focus-Driven Fine-Grained Reasoning on Dense Charts
por: Pan, Hongkun, et al.
Publicado: (2026)
por: Pan, Hongkun, et al.
Publicado: (2026)
Segment Any Vehicle: Semantic and Visual Context Driven SAM and A Benchmark
por: Wang, Xiao, et al.
Publicado: (2025)
por: Wang, Xiao, et al.
Publicado: (2025)
Rethinking Visual Prompting for Multimodal Large Language Models with External Knowledge
por: Lin, Yuanze, et al.
Publicado: (2024)
por: Lin, Yuanze, et al.
Publicado: (2024)
Beyond Sight: Towards Cognitive Alignment in LVLM via Enriched Visual Knowledge
por: Zhao, Yaqi, et al.
Publicado: (2024)
por: Zhao, Yaqi, et al.
Publicado: (2024)
Boosting Fine-Grained Visual Anomaly Detection with Coarse-Knowledge-Aware Adversarial Learning
por: Fang, Qingqing, et al.
Publicado: (2024)
por: Fang, Qingqing, et al.
Publicado: (2024)
Visual Error Patterns in Multi-Modal AI: A Statistical Approach
por: Wang, Ching-Yi
Publicado: (2024)
por: Wang, Ching-Yi
Publicado: (2024)
Knowledge Translation: A New Pathway for Model Compression
por: Sun, Wujie, et al.
Publicado: (2024)
por: Sun, Wujie, et al.
Publicado: (2024)
AutoMC: Automated Model Compression based on Domain Knowledge and Progressive search strategy
por: Wang, Chunnan, et al.
Publicado: (2022)
por: Wang, Chunnan, et al.
Publicado: (2022)
Future-Proof Yourself: An AI Era Survival Guide
por: Kim, Taehoon
Publicado: (2025)
por: Kim, Taehoon
Publicado: (2025)
OISD: On-Policy Internal Self-Distillation of Language Models
por: Liu, Xinyu, et al.
Publicado: (2026)
por: Liu, Xinyu, et al.
Publicado: (2026)
Break the Visual Perception: Adversarial Attacks Targeting Encoded Visual Tokens of Large Vision-Language Models
por: Wang, Yubo, et al.
Publicado: (2024)
por: Wang, Yubo, et al.
Publicado: (2024)
RAR: Retrieving And Ranking Augmented MLLMs for Visual Recognition
por: Liu, Ziyu, et al.
Publicado: (2024)
por: Liu, Ziyu, et al.
Publicado: (2024)
VIAssist: Adapting Multi-modal Large Language Models for Users with Visual Impairments
por: Yang, Bufang, et al.
Publicado: (2024)
por: Yang, Bufang, et al.
Publicado: (2024)
Nonverbal Interaction Detection
por: Wei, Jianan, et al.
Publicado: (2024)
por: Wei, Jianan, et al.
Publicado: (2024)
Shape2Scene: 3D Scene Representation Learning Through Pre-training on Shape Data
por: Feng, Tuo, et al.
Publicado: (2024)
por: Feng, Tuo, et al.
Publicado: (2024)
Moving Beyond Diffusion: Hierarchy-to-Hierarchy Autoregression for fMRI-to-Image Reconstruction
por: Zhang, Xu, et al.
Publicado: (2025)
por: Zhang, Xu, et al.
Publicado: (2025)
When Does Supervised Training Pay Off? The Hidden Economics of Object Detection in the Era of Vision-Language Models
por: Al-Hamadani, Samer
Publicado: (2025)
por: Al-Hamadani, Samer
Publicado: (2025)
Knowledge Graph Enhanced Generative Multi-modal Models for Class-Incremental Learning
por: Cao, Xusheng, et al.
Publicado: (2025)
por: Cao, Xusheng, et al.
Publicado: (2025)
Machine Learning Modeling for Multi-order Human Visual Motion Processing
por: Sun, Zitang, et al.
Publicado: (2025)
por: Sun, Zitang, et al.
Publicado: (2025)
Machine Unlearning in the Era of Quantum Machine Learning: An Empirical Study
por: Crivoi, Carla, et al.
Publicado: (2025)
por: Crivoi, Carla, et al.
Publicado: (2025)
AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models
por: Mai, Zheda, et al.
Publicado: (2025)
por: Mai, Zheda, et al.
Publicado: (2025)
Emergent Visual Grounding in Large Multimodal Models Without Grounding Supervision
por: Cao, Shengcao, et al.
Publicado: (2024)
por: Cao, Shengcao, et al.
Publicado: (2024)
Understanding Visual Concepts Across Models
por: Trabucco, Brandon, et al.
Publicado: (2024)
por: Trabucco, Brandon, et al.
Publicado: (2024)
An Investigation of Visual Foundation Models Robustness
por: Gupta, Sandeep, et al.
Publicado: (2025)
por: Gupta, Sandeep, et al.
Publicado: (2025)
Dataset Distillation via Curriculum Data Synthesis in Large Data Era
por: Yin, Zeyuan, et al.
Publicado: (2023)
por: Yin, Zeyuan, et al.
Publicado: (2023)
Neuron Abandoning Attention Flow: Visual Explanation of Dynamics inside CNN Models
por: Liao, Yi, et al.
Publicado: (2024)
por: Liao, Yi, et al.
Publicado: (2024)
SparVAR: Exploring Sparsity in Visual AutoRegressive Modeling for Training-Free Acceleration
por: Li, Zekun, et al.
Publicado: (2026)
por: Li, Zekun, et al.
Publicado: (2026)
CLIPErase: Efficient Unlearning of Visual-Textual Associations in CLIP
por: Yang, Tianyu, et al.
Publicado: (2024)
por: Yang, Tianyu, et al.
Publicado: (2024)
Uni4D: Unifying Visual Foundation Models for 4D Modeling from a Single Video
por: Yao, David Yifan, et al.
Publicado: (2025)
por: Yao, David Yifan, et al.
Publicado: (2025)
Ejemplares similares
-
Towards Data-and Knowledge-Driven Artificial Intelligence: A Survey on Neuro-Symbolic Computing
por: Wang, Wenguan, et al.
Publicado: (2022) -
The Hidden Life of Tokens: Reducing Hallucination of Large Vision-Language Models via Visual Information Steering
por: Li, Zhuowei, et al.
Publicado: (2025) -
Revisiting Model Stitching In the Foundation Model Era
por: Mai, Zheda, et al.
Publicado: (2026) -
Anatomy-VLM: A Fine-grained Vision-Language Model for Medical Interpretation
por: Gu, Difei, et al.
Publicado: (2025) -
RadAlign: Advancing Radiology Report Generation with Vision-Language Concept Alignment
por: Gu, Difei, et al.
Publicado: (2025)