Rethinking Prompting Strategies for Multi-Label Recognition with Partial Annotations
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Rawlekar, Samyak, Bhatnagar, Shubhang, Ahuja, Narendra |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Improving Multi-label Recognition using Class Co-Occurrence Probabilities
par: Rawlekar, Samyak, et autres
Publié: (2024)
par: Rawlekar, Samyak, et autres
Publié: (2024)
Finding Distributed Object-Centric Properties in Self-Supervised Transformers
par: Rawlekar, Samyak, et autres
Publié: (2026)
par: Rawlekar, Samyak, et autres
Publié: (2026)
Piecewise-Linear Manifolds for Deep Metric Learning
par: Bhatnagar, Shubhang, et autres
Publié: (2024)
par: Bhatnagar, Shubhang, et autres
Publié: (2024)
Potential Field Based Deep Metric Learning
par: Bhatnagar, Shubhang, et autres
Publié: (2024)
par: Bhatnagar, Shubhang, et autres
Publié: (2024)
Beyond the Leaderboard: Rethinking Medical Benchmarks for Large Language Models
par: Chen, Wenting, et autres
Publié: (2025)
par: Chen, Wenting, et autres
Publié: (2025)
LUQ: Layerwise Ultra-Low Bit Quantization for Multimodal Large Language Models
par: Bhatnagar, Shubhang, et autres
Publié: (2025)
par: Bhatnagar, Shubhang, et autres
Publié: (2025)
LookAhead Tuning: Safer Language Models via Partial Answer Previews
par: Liu, Kangwei, et autres
Publié: (2025)
par: Liu, Kangwei, et autres
Publié: (2025)
MultiMed: Massively Multimodal and Multitask Medical Understanding
par: Mo, Shentong, et autres
Publié: (2024)
par: Mo, Shentong, et autres
Publié: (2024)
MultiIoT: Benchmarking Machine Learning for the Internet of Things
par: Mo, Shentong, et autres
Publié: (2023)
par: Mo, Shentong, et autres
Publié: (2023)
Multi-level Mixture of Experts for Multimodal Entity Linking
par: Hu, Zhiwei, et autres
Publié: (2025)
par: Hu, Zhiwei, et autres
Publié: (2025)
MB-ORES: A Multi-Branch Object Reasoner for Visual Grounding in Remote Sensing
par: Radouane, Karim, et autres
Publié: (2025)
par: Radouane, Karim, et autres
Publié: (2025)
Evaluating Semantic Variation in Text-to-Image Synthesis: A Causal Perspective
par: Zhu, Xiangru, et autres
Publié: (2024)
par: Zhu, Xiangru, et autres
Publié: (2024)
WorDepth: Variational Language Prior for Monocular Depth Estimation
par: Zeng, Ziyao, et autres
Publié: (2024)
par: Zeng, Ziyao, et autres
Publié: (2024)
GenAI-Bench: Evaluating and Improving Compositional Text-to-Visual Generation
par: Li, Baiqi, et autres
Publié: (2024)
par: Li, Baiqi, et autres
Publié: (2024)
State Space Model for New-Generation Network Alternative to Transformers: A Survey
par: Wang, Xiao, et autres
Publié: (2024)
par: Wang, Xiao, et autres
Publié: (2024)
Foundations of Multisensory Artificial Intelligence
par: Liang, Paul Pu
Publié: (2024)
par: Liang, Paul Pu
Publié: (2024)
To Forget or Not? Towards Practical Knowledge Unlearning for Large Language Models
par: Tian, Bozhong, et autres
Publié: (2024)
par: Tian, Bozhong, et autres
Publié: (2024)
MLLM can see? Dynamic Correction Decoding for Hallucination Mitigation
par: Wang, Chenxi, et autres
Publié: (2024)
par: Wang, Chenxi, et autres
Publié: (2024)
Seeing is Believing: Mitigating Hallucination in Large Vision-Language Models via CLIP-Guided Decoding
par: Deng, Ailin, et autres
Publié: (2024)
par: Deng, Ailin, et autres
Publié: (2024)
NVLM: Open Frontier-Class Multimodal LLMs
par: Dai, Wenliang, et autres
Publié: (2024)
par: Dai, Wenliang, et autres
Publié: (2024)
Evaluating Text-to-Visual Generation with Image-to-Text Generation
par: Lin, Zhiqiu, et autres
Publié: (2024)
par: Lin, Zhiqiu, et autres
Publié: (2024)
AID: Adapting Image2Video Diffusion Models for Instruction-guided Video Prediction
par: Xing, Zhen, et autres
Publié: (2024)
par: Xing, Zhen, et autres
Publié: (2024)
SafaRi:Adaptive Sequence Transformer for Weakly Supervised Referring Expression Segmentation
par: Nag, Sayan, et autres
Publié: (2024)
par: Nag, Sayan, et autres
Publié: (2024)
A Review of Multimodal Explainable Artificial Intelligence: Past, Present and Future
par: Sun, Shilin, et autres
Publié: (2024)
par: Sun, Shilin, et autres
Publié: (2024)
OmniEvalKit: A Modular, Lightweight Toolbox for Evaluating Large Language Model and its Omni-Extensions
par: Zhang, Yi-Kai, et autres
Publié: (2024)
par: Zhang, Yi-Kai, et autres
Publié: (2024)
SILMM: Self-Improving Large Multimodal Models for Compositional Text-to-Image Generation
par: Qu, Leigang, et autres
Publié: (2024)
par: Qu, Leigang, et autres
Publié: (2024)
IoT-LM: Large Multisensory Language Models for the Internet of Things
par: Mo, Shentong, et autres
Publié: (2024)
par: Mo, Shentong, et autres
Publié: (2024)
TIGeR: Unifying Text-to-Image Generation and Retrieval with Large Multimodal Models
par: Qu, Leigang, et autres
Publié: (2024)
par: Qu, Leigang, et autres
Publié: (2024)
RAP: Retrieval-Augmented Personalization for Multimodal Large Language Models
par: Hao, Haoran, et autres
Publié: (2024)
par: Hao, Haoran, et autres
Publié: (2024)
Beyond Embeddings: The Promise of Visual Table in Visual Reasoning
par: Zhong, Yiwu, et autres
Publié: (2024)
par: Zhong, Yiwu, et autres
Publié: (2024)
Heracles: A Hybrid SSM-Transformer Model for High-Resolution Image and Time-Series Analysis
par: Patro, Badri N., et autres
Publié: (2024)
par: Patro, Badri N., et autres
Publié: (2024)
ADS-Edit: A Multimodal Knowledge Editing Dataset for Autonomous Driving Systems
par: Wang, Chenxi, et autres
Publié: (2025)
par: Wang, Chenxi, et autres
Publié: (2025)
GoT-R1: Unleashing Reasoning Capability of MLLM for Visual Generation with Reinforcement Learning
par: Duan, Chengqi, et autres
Publié: (2025)
par: Duan, Chengqi, et autres
Publié: (2025)
OmniGAIA: Towards Native Omni-Modal AI Agents
par: Li, Xiaoxi, et autres
Publié: (2026)
par: Li, Xiaoxi, et autres
Publié: (2026)
Contrastive Visual Data Augmentation
par: Zhou, Yu, et autres
Publié: (2025)
par: Zhou, Yu, et autres
Publié: (2025)
Generative AI for Character Animation: A Comprehensive Survey of Techniques, Applications, and Future Directions
par: Abootorabi, Mohammad Mahdi, et autres
Publié: (2025)
par: Abootorabi, Mohammad Mahdi, et autres
Publié: (2025)
Multimodal Long Video Modeling Based on Temporal Dynamic Context
par: Hao, Haoran, et autres
Publié: (2025)
par: Hao, Haoran, et autres
Publié: (2025)
LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention
par: Zhang, Renrui, et autres
Publié: (2023)
par: Zhang, Renrui, et autres
Publié: (2023)
Aligning Agentic World Models via Knowledgeable Experience Learning
par: Ren, Baochang, et autres
Publié: (2026)
par: Ren, Baochang, et autres
Publié: (2026)
Machine Unlearning in Hyperbolic vs. Euclidean Multimodal Contrastive Learning: Adapting Alignment Calibration to MERU
par: Vidal, Àlex Pujol, et autres
Publié: (2025)
par: Vidal, Àlex Pujol, et autres
Publié: (2025)
Documents similaires
-
Improving Multi-label Recognition using Class Co-Occurrence Probabilities
par: Rawlekar, Samyak, et autres
Publié: (2024) -
Finding Distributed Object-Centric Properties in Self-Supervised Transformers
par: Rawlekar, Samyak, et autres
Publié: (2026) -
Piecewise-Linear Manifolds for Deep Metric Learning
par: Bhatnagar, Shubhang, et autres
Publié: (2024) -
Potential Field Based Deep Metric Learning
par: Bhatnagar, Shubhang, et autres
Publié: (2024) -
Beyond the Leaderboard: Rethinking Medical Benchmarks for Large Language Models
par: Chen, Wenting, et autres
Publié: (2025)