Unleashing the Potential of Model Bias for Generalized Category Discovery
Fuente:
arXiv
Salvato in:
| Autori principali: | An, Wenbin, Lin, Haonan, Nie, Jiahao, Tian, Feng, Shi, Wenkai, Wu, Yaqiang, Wang, Qianying, Chen, Ping |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Knowledge Acquisition Disentanglement for Knowledge-based Visual Question Answering with Large Language Models
di: An, Wenbin, et al.
Pubblicazione: (2024)
di: An, Wenbin, et al.
Pubblicazione: (2024)
Flipped Classroom: Aligning Teacher Attention with Student in Generalized Category Discovery
di: Lin, Haonan, et al.
Pubblicazione: (2024)
di: Lin, Haonan, et al.
Pubblicazione: (2024)
Empowering Multimodal LLMs with External Tools: A Comprehensive Survey
di: An, Wenbin, et al.
Pubblicazione: (2025)
di: An, Wenbin, et al.
Pubblicazione: (2025)
Mitigating Object Hallucinations in Large Vision-Language Models with Assembly of Global and Local Attention
di: An, Wenbin, et al.
Pubblicazione: (2024)
di: An, Wenbin, et al.
Pubblicazione: (2024)
Generalized Category Discovery with Large Language Models in the Loop
di: An, Wenbin, et al.
Pubblicazione: (2023)
di: An, Wenbin, et al.
Pubblicazione: (2023)
GET: Unlocking the Multi-modal Potential of CLIP for Generalized Category Discovery
di: Wang, Enguang, et al.
Pubblicazione: (2024)
di: Wang, Enguang, et al.
Pubblicazione: (2024)
Schedule Your Edit: A Simple yet Effective Diffusion Noise Schedule for Image Editing
di: Lin, Haonan, et al.
Pubblicazione: (2024)
di: Lin, Haonan, et al.
Pubblicazione: (2024)
Mechanistic Diagnostics of Spatial Lexical Bias in Multimodal Large Language Model Spatial Reasoning
di: Ma, Chuang, et al.
Pubblicazione: (2026)
di: Ma, Chuang, et al.
Pubblicazione: (2026)
Unleashing Perception-Time Scaling to Multimodal Reasoning Models
di: Li, Yifan, et al.
Pubblicazione: (2025)
di: Li, Yifan, et al.
Pubblicazione: (2025)
Speak While Watching: Unleashing TRUE Real-Time Video Understanding Capability of Multimodal Large Language Models
di: Lin, Junyan, et al.
Pubblicazione: (2026)
di: Lin, Junyan, et al.
Pubblicazione: (2026)
Active Generalized Category Discovery
di: Ma, Shijie, et al.
Pubblicazione: (2024)
di: Ma, Shijie, et al.
Pubblicazione: (2024)
Pi-GPS: Enhancing Geometry Problem Solving by Unleashing the Power of Diagrammatic Information
di: Zhao, Junbo, et al.
Pubblicazione: (2025)
di: Zhao, Junbo, et al.
Pubblicazione: (2025)
Unleashing Hour-Scale Video Training for Long Video-Language Understanding
di: Lin, Jingyang, et al.
Pubblicazione: (2025)
di: Lin, Jingyang, et al.
Pubblicazione: (2025)
Plot2Code: A Comprehensive Benchmark for Evaluating Multi-modal Large Language Models in Code Generation from Scientific Plots
di: Wu, Chengyue, et al.
Pubblicazione: (2024)
di: Wu, Chengyue, et al.
Pubblicazione: (2024)
Unleashing Spatial Reasoning in Multimodal Large Language Models via Textual Representation Guided Reasoning
di: Hua, Jiacheng, et al.
Pubblicazione: (2026)
di: Hua, Jiacheng, et al.
Pubblicazione: (2026)
Towards Distribution-Agnostic Generalized Category Discovery
di: Bai, Jianhong, et al.
Pubblicazione: (2023)
di: Bai, Jianhong, et al.
Pubblicazione: (2023)
DreamSalon: A Staged Diffusion Framework for Preserving Identity-Context in Editable Face Generation
di: Lin, Haonan, et al.
Pubblicazione: (2024)
di: Lin, Haonan, et al.
Pubblicazione: (2024)
An Empirical Study on Configuring In-Context Learning Demonstrations for Unleashing MLLMs' Sentimental Perception Capability
di: Wu, Daiqing, et al.
Pubblicazione: (2025)
di: Wu, Daiqing, et al.
Pubblicazione: (2025)
Make-it-Real: Unleashing Large Multimodal Model for Painting 3D Objects with Realistic Materials
di: Fang, Ye, et al.
Pubblicazione: (2024)
di: Fang, Ye, et al.
Pubblicazione: (2024)
The Solution for Language-Enhanced Image New Category Discovery
di: Xu, Haonan, et al.
Pubblicazione: (2024)
di: Xu, Haonan, et al.
Pubblicazione: (2024)
Contextuality Helps Representation Learning for Generalized Category Discovery
di: Luo, Tingzhang, et al.
Pubblicazione: (2024)
di: Luo, Tingzhang, et al.
Pubblicazione: (2024)
Solving the Catastrophic Forgetting Problem in Generalized Category Discovery
di: Cao, Xinzi, et al.
Pubblicazione: (2025)
di: Cao, Xinzi, et al.
Pubblicazione: (2025)
Correctable Landmark Discovery via Large Models for Vision-Language Navigation
di: Lin, Bingqian, et al.
Pubblicazione: (2024)
di: Lin, Bingqian, et al.
Pubblicazione: (2024)
Reasoning Resides in Layers: Restoring Temporal Reasoning in Video-Language Models with Layer-Selective Merging
di: Fu, Zihang, et al.
Pubblicazione: (2026)
di: Fu, Zihang, et al.
Pubblicazione: (2026)
Tracing the Arrow of Time: Diagnosing Temporal Information Flow in Video-LLMs
di: Han, Peitao, et al.
Pubblicazione: (2026)
di: Han, Peitao, et al.
Pubblicazione: (2026)
LayoutCoT: Unleashing the Deep Reasoning Potential of Large Language Models for Layout Generation
di: Shi, Hengyu, et al.
Pubblicazione: (2025)
di: Shi, Hengyu, et al.
Pubblicazione: (2025)
PEA-Diffusion: Parameter-Efficient Adapter with Knowledge Distillation in non-English Text-to-Image Generation
di: Ma, Jian, et al.
Pubblicazione: (2023)
di: Ma, Jian, et al.
Pubblicazione: (2023)
Can Prompt Modifiers Control Bias? A Comparative Analysis of Text-to-Image Generative Models
di: Shin, Philip Wootaek, et al.
Pubblicazione: (2024)
di: Shin, Philip Wootaek, et al.
Pubblicazione: (2024)
Online Continuous Generalized Category Discovery
di: Park, Keon-Hee, et al.
Pubblicazione: (2024)
di: Park, Keon-Hee, et al.
Pubblicazione: (2024)
Consistent Supervised-Unsupervised Alignment for Generalized Category Discovery
di: Han, Jizhou, et al.
Pubblicazione: (2025)
di: Han, Jizhou, et al.
Pubblicazione: (2025)
AviationLMM: A Large Multimodal Foundation Model for Civil Aviation
di: Li, Wenbin, et al.
Pubblicazione: (2026)
di: Li, Wenbin, et al.
Pubblicazione: (2026)
Generalized Category Discovery under Domain Shift: A Frequency Domain Perspective
di: Feng, Wei, et al.
Pubblicazione: (2025)
di: Feng, Wei, et al.
Pubblicazione: (2025)
HAIC: Improving Human Action Understanding and Generation with Better Captions for Multi-modal Large Language Models
di: Wang, Xiao, et al.
Pubblicazione: (2025)
di: Wang, Xiao, et al.
Pubblicazione: (2025)
Navigating Text-to-Image Generative Bias across Indic Languages
di: Mittal, Surbhi, et al.
Pubblicazione: (2024)
di: Mittal, Surbhi, et al.
Pubblicazione: (2024)
Can CLIP Count Stars? An Empirical Study on Quantity Bias in CLIP
di: Zhang, Zeliang, et al.
Pubblicazione: (2024)
di: Zhang, Zeliang, et al.
Pubblicazione: (2024)
Draw ALL Your Imagine: A Holistic Benchmark and Agent Framework for Complex Instruction-based Image Generation
di: Zhou, Yucheng, et al.
Pubblicazione: (2025)
di: Zhou, Yucheng, et al.
Pubblicazione: (2025)
MOS: Modeling Object-Scene Associations in Generalized Category Discovery
di: Peng, Zhengyuan, et al.
Pubblicazione: (2025)
di: Peng, Zhengyuan, et al.
Pubblicazione: (2025)
Towards Transparent AI: A Survey on Explainable Large Language Models
di: Palikhe, Avash, et al.
Pubblicazione: (2025)
di: Palikhe, Avash, et al.
Pubblicazione: (2025)
Few-Shot Generalized Category Discovery With Retrieval-Guided Decision Boundary Enhancement
di: Ren, Yunhan, et al.
Pubblicazione: (2025)
di: Ren, Yunhan, et al.
Pubblicazione: (2025)
Investigating Spatial Attention Bias in Vision-Language Models
di: Chaudhary, Aryan, et al.
Pubblicazione: (2025)
di: Chaudhary, Aryan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Knowledge Acquisition Disentanglement for Knowledge-based Visual Question Answering with Large Language Models
di: An, Wenbin, et al.
Pubblicazione: (2024) -
Flipped Classroom: Aligning Teacher Attention with Student in Generalized Category Discovery
di: Lin, Haonan, et al.
Pubblicazione: (2024) -
Empowering Multimodal LLMs with External Tools: A Comprehensive Survey
di: An, Wenbin, et al.
Pubblicazione: (2025) -
Mitigating Object Hallucinations in Large Vision-Language Models with Assembly of Global and Local Attention
di: An, Wenbin, et al.
Pubblicazione: (2024) -
Generalized Category Discovery with Large Language Models in the Loop
di: An, Wenbin, et al.
Pubblicazione: (2023)