HA-FGOVD: Highlighting Fine-grained Attributes via Explicit Linear Composition for Open-Vocabulary Object Detection
Fuente:
arXiv
Guardado en:
| Autores principales: | Ma, Yuqi, Liu, Mengyin, Zhu, Chao, Yin, Xu-Cheng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SpeechCraft: A Fine-grained Expressive Speech Dataset with Natural Language Description
por: Jin, Zeyu, et al.
Publicado: (2024)
por: Jin, Zeyu, et al.
Publicado: (2024)
ChartEditor: A Reinforcement Learning Framework for Robust Chart Editing
por: Chen, Liangyu, et al.
Publicado: (2025)
por: Chen, Liangyu, et al.
Publicado: (2025)
Multimodal Multi-turn Conversation Stance Detection: A Challenge Dataset and Effective Model
por: Niu, Fuqiang, et al.
Publicado: (2024)
por: Niu, Fuqiang, et al.
Publicado: (2024)
Lighthouse: A User-Friendly Library for Reproducible Video Moment Retrieval and Highlight Detection
por: Nishimura, Taichi, et al.
Publicado: (2024)
por: Nishimura, Taichi, et al.
Publicado: (2024)
P2P: Automated Paper-to-Poster Generation and Fine-Grained Benchmark
por: Sun, Tao, et al.
Publicado: (2025)
por: Sun, Tao, et al.
Publicado: (2025)
TeleAntiFraud-28k: An Audio-Text Slow-Thinking Dataset for Telecom Fraud Detection
por: Ma, Zhiming, et al.
Publicado: (2025)
por: Ma, Zhiming, et al.
Publicado: (2025)
MMAPS: End-to-End Multi-Grained Multi-Modal Attribute-Aware Product Summarization
por: Chen, Tao, et al.
Publicado: (2023)
por: Chen, Tao, et al.
Publicado: (2023)
FineFake: A Knowledge-Enriched Dataset for Fine-Grained Multi-Domain Fake News Detection
por: Zhou, Ziyi, et al.
Publicado: (2024)
por: Zhou, Ziyi, et al.
Publicado: (2024)
SLAM-LLM: A Modular, Open-Source Multimodal Large Language Model Framework and Best Practice for Speech, Language, Audio and Music Processing
por: Ma, Ziyang, et al.
Publicado: (2026)
por: Ma, Ziyang, et al.
Publicado: (2026)
OmniTrace: A Unified Framework for Generation-Time Attribution in Omni-Modal LLMs
por: Yan, Qianqi, et al.
Publicado: (2026)
por: Yan, Qianqi, et al.
Publicado: (2026)
CMATH: Cross-Modality Augmented Transformer with Hierarchical Variational Distillation for Multimodal Emotion Recognition in Conversation
por: Zhu, Xiaofei, et al.
Publicado: (2024)
por: Zhu, Xiaofei, et al.
Publicado: (2024)
Less for More: Enhanced Feedback-aligned Mixed LLMs for Molecule Caption Generation and Fine-Grained NLI Evaluation
por: Gkoumas, Dimitris, et al.
Publicado: (2024)
por: Gkoumas, Dimitris, et al.
Publicado: (2024)
MIND Your Reasoning: A Meta-Cognitive Intuitive-Reflective Network for Dual-Reasoning in Multimodal Stance Detection
por: Wang, Bingbing, et al.
Publicado: (2025)
por: Wang, Bingbing, et al.
Publicado: (2025)
Distilling Implicit Multimodal Knowledge into Large Language Models for Zero-Resource Dialogue Generation
por: Zhang, Bo, et al.
Publicado: (2024)
por: Zhang, Bo, et al.
Publicado: (2024)
MIntRec2.0: A Large-scale Benchmark Dataset for Multimodal Intent Recognition and Out-of-scope Detection in Conversations
por: Zhang, Hanlei, et al.
Publicado: (2024)
por: Zhang, Hanlei, et al.
Publicado: (2024)
The Interspeech 2026 Audio Reasoning Challenge: Evaluating Reasoning Process Quality for Audio Reasoning Models and Agents
por: Ma, Ziyang, et al.
Publicado: (2026)
por: Ma, Ziyang, et al.
Publicado: (2026)
Traits Run Deep: Enhancing Personality Assessment via Psychology-Guided LLM Representations and Multimodal Apparent Behaviors
por: Li, Jia, et al.
Publicado: (2025)
por: Li, Jia, et al.
Publicado: (2025)
Audio ControlNet for Fine-Grained Audio Generation and Editing
por: Zhu, Haina, et al.
Publicado: (2026)
por: Zhu, Haina, et al.
Publicado: (2026)
Data-Efficient Hate Speech Detection via Cross-Lingual Nearest Neighbor Retrieval with Limited Labeled Data
por: Ghorbanpour, Faeze, et al.
Publicado: (2025)
por: Ghorbanpour, Faeze, et al.
Publicado: (2025)
Retrieval-Augmented Multimodal Model for Fake News Detection
por: Li, Yiheng, et al.
Publicado: (2026)
por: Li, Yiheng, et al.
Publicado: (2026)
Learning Domain-Invariant Features for Out-of-Context News Detection
por: Gu, Yimeng, et al.
Publicado: (2024)
por: Gu, Yimeng, et al.
Publicado: (2024)
Multi-MLLM Knowledge Distillation for Out-of-Context News Detection
por: Gu, Yimeng, et al.
Publicado: (2025)
por: Gu, Yimeng, et al.
Publicado: (2025)
Lost in Overlap: Exploring Logit-based Watermark Collision in LLMs
por: Luo, Yiyang, et al.
Publicado: (2024)
por: Luo, Yiyang, et al.
Publicado: (2024)
A Benchmark and Robustness Study of In-Context-Learning with Large Language Models in Music Entity Detection
por: Hachmeier, Simon, et al.
Publicado: (2024)
por: Hachmeier, Simon, et al.
Publicado: (2024)
Collaborative Evolution: Multi-Round Learning Between Large and Small Language Models for Emergent Fake News Detection
por: Zhou, Ziyi, et al.
Publicado: (2025)
por: Zhou, Ziyi, et al.
Publicado: (2025)
EEG2TEXT-CN: An Exploratory Study of Open-Vocabulary Chinese Text-EEG Alignment via Large Language Model and Contrastive Learning on ChineseEEG
por: Lu, Jacky Tai-Yu, et al.
Publicado: (2025)
por: Lu, Jacky Tai-Yu, et al.
Publicado: (2025)
Decompose and Transfer: CoT-Prompting Enhanced Alignment for Open-Vocabulary Temporal Action Detection
por: Zhu, Sa, et al.
Publicado: (2026)
por: Zhu, Sa, et al.
Publicado: (2026)
ShieldVLM: Safeguarding the Multimodal Implicit Toxicity via Deliberative Reasoning with LVLMs
por: Cui, Shiyao, et al.
Publicado: (2025)
por: Cui, Shiyao, et al.
Publicado: (2025)
ChartAdapter: Large Vision-Language Model for Chart Summarization
por: Xu, Peixin, et al.
Publicado: (2024)
por: Xu, Peixin, et al.
Publicado: (2024)
Evaluating Multimodal Large Language Models on Spoken Sarcasm Understanding
por: Li, Zhu, et al.
Publicado: (2025)
por: Li, Zhu, et al.
Publicado: (2025)
Robust Symbolic Reasoning for Visual Narratives via Hierarchical and Semantically Normalized Knowledge Graphs
por: Chen, Yi-Chun
Publicado: (2025)
por: Chen, Yi-Chun
Publicado: (2025)
Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation
por: Liu, Dancheng, et al.
Publicado: (2025)
por: Liu, Dancheng, et al.
Publicado: (2025)
LaF-GRPO: In-Situ Navigation Instruction Generation for the Visually Impaired via GRPO with LLM-as-Follower Reward
por: Zhao, Yi, et al.
Publicado: (2025)
por: Zhao, Yi, et al.
Publicado: (2025)
ResearchPulse: Building Method-Experiment Chains through Multi-Document Scientific Inference
por: Chen, Qi, et al.
Publicado: (2025)
por: Chen, Qi, et al.
Publicado: (2025)
Video2Roleplay: A Multimodal Dataset and Framework for Video-Guided Role-playing Agents
por: Zhang, Xueqiao, et al.
Publicado: (2025)
por: Zhang, Xueqiao, et al.
Publicado: (2025)
Hierarchical Aligned Multimodal Learning for NER on Tweet Posts
por: Liu, Peipei, et al.
Publicado: (2023)
por: Liu, Peipei, et al.
Publicado: (2023)
UMETTS: A Unified Framework for Emotional Text-to-Speech Synthesis with Multimodal Prompts
por: Cheng, Zhi-Qi, et al.
Publicado: (2024)
por: Cheng, Zhi-Qi, et al.
Publicado: (2024)
MAC-SLU: Multi-Intent Automotive Cabin Spoken Language Understanding Benchmark
por: Peng, Yuezhang, et al.
Publicado: (2025)
por: Peng, Yuezhang, et al.
Publicado: (2025)
IBMEA: Exploring Variational Information Bottleneck for Multi-modal Entity Alignment
por: Su, Taoyu, et al.
Publicado: (2024)
por: Su, Taoyu, et al.
Publicado: (2024)
HI-TransPA: Hearing Impairments Translation Personal Assistant
por: Ma, Zhiming, et al.
Publicado: (2025)
por: Ma, Zhiming, et al.
Publicado: (2025)
Ejemplares similares
-
SpeechCraft: A Fine-grained Expressive Speech Dataset with Natural Language Description
por: Jin, Zeyu, et al.
Publicado: (2024) -
ChartEditor: A Reinforcement Learning Framework for Robust Chart Editing
por: Chen, Liangyu, et al.
Publicado: (2025) -
Multimodal Multi-turn Conversation Stance Detection: A Challenge Dataset and Effective Model
por: Niu, Fuqiang, et al.
Publicado: (2024) -
Lighthouse: A User-Friendly Library for Reproducible Video Moment Retrieval and Highlight Detection
por: Nishimura, Taichi, et al.
Publicado: (2024) -
P2P: Automated Paper-to-Poster Generation and Fine-Grained Benchmark
por: Sun, Tao, et al.
Publicado: (2025)