NEMO: Can Multimodal LLMs Identify Attribute-Modified Objects?
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Jiaxuan, Mo, Junwen, Vo, MinhDuc, Sugimoto, Akihiro, Nakayama, Hideki |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
EVCap: Retrieval-Augmented Image Captioning with External Visual-Name Memory for Open-World Comprehension
di: Li, Jiaxuan, et al.
Pubblicazione: (2023)
di: Li, Jiaxuan, et al.
Pubblicazione: (2023)
Persistent Test-time Adaptation in Recurring Testing Scenarios
di: Hoang, Trung-Hieu, et al.
Pubblicazione: (2023)
di: Hoang, Trung-Hieu, et al.
Pubblicazione: (2023)
SAMURAI: Shape-Aware Multimodal Retrieval for 3D Object Identification
di: Vo, Dinh-Khoi, et al.
Pubblicazione: (2025)
di: Vo, Dinh-Khoi, et al.
Pubblicazione: (2025)
Interactive Masked Image Modeling for Multimodal Object Detection in Remote Sensing
di: Vu, Minh-Duc, et al.
Pubblicazione: (2024)
di: Vu, Minh-Duc, et al.
Pubblicazione: (2024)
TESO: Online Tracking of Essential Matrix by Stochastic Optimization
di: Moravec, Jaroslav, et al.
Pubblicazione: (2026)
di: Moravec, Jaroslav, et al.
Pubblicazione: (2026)
Improving the Robustness of 3D Human Pose Estimation: A Benchmark and Learning from Noisy Input
di: Hoang, Trung-Hieu, et al.
Pubblicazione: (2023)
di: Hoang, Trung-Hieu, et al.
Pubblicazione: (2023)
EOC-Bench: Can MLLMs Identify, Recall, and Forecast Objects in an Egocentric World?
di: Yuan, Yuqian, et al.
Pubblicazione: (2025)
di: Yuan, Yuqian, et al.
Pubblicazione: (2025)
Measuring Image-Relation Alignment: Reference-Free Evaluation of VLMs and Synthetic Pre-training for Open-Vocabulary Scene Graph Generation
di: Neau, Maëlic, et al.
Pubblicazione: (2025)
di: Neau, Maëlic, et al.
Pubblicazione: (2025)
HOI-R1: Exploring the Potential of Multimodal Large Language Models for Human-Object Interaction Detection
di: Chen, Junwen, et al.
Pubblicazione: (2025)
di: Chen, Junwen, et al.
Pubblicazione: (2025)
Towards Open-Vocabulary Multimodal 3D Object Detection with Attributes
di: Xiang, Xinhao, et al.
Pubblicazione: (2025)
di: Xiang, Xinhao, et al.
Pubblicazione: (2025)
EagleVision: Object-level Attribute Multimodal LLM for Remote Sensing
di: Jiang, Hongxiang, et al.
Pubblicazione: (2025)
di: Jiang, Hongxiang, et al.
Pubblicazione: (2025)
Towards Agentic AI for Multimodal-Guided Video Object Segmentation
di: Tran, Tuyen, et al.
Pubblicazione: (2025)
di: Tran, Tuyen, et al.
Pubblicazione: (2025)
InstructAttribute: Fine-grained Object Attributes editing with Instruction
di: Yin, Xingxi, et al.
Pubblicazione: (2025)
di: Yin, Xingxi, et al.
Pubblicazione: (2025)
Enhanced Data Transfer Cooperating with Artificial Triplets for Scene Graph Generation
di: Chu, KuanChao, et al.
Pubblicazione: (2024)
di: Chu, KuanChao, et al.
Pubblicazione: (2024)
Can LLMs' Tuning Methods Work in Medical Multimodal Domain?
di: Chen, Jiawei, et al.
Pubblicazione: (2024)
di: Chen, Jiawei, et al.
Pubblicazione: (2024)
EVENT-Retriever: Event-Aware Multimodal Image Retrieval for Realistic Captions
di: Vo, Dinh-Khoi, et al.
Pubblicazione: (2025)
di: Vo, Dinh-Khoi, et al.
Pubblicazione: (2025)
Hierarchical Neural Collapse Detection Transformer for Class Incremental Object Detection
di: Pham, Duc Thanh, et al.
Pubblicazione: (2025)
di: Pham, Duc Thanh, et al.
Pubblicazione: (2025)
TI-JEPA: An Innovative Energy-based Joint Embedding Strategy for Text-Image Multimodal Systems
di: Vo, Khang H. N., et al.
Pubblicazione: (2025)
di: Vo, Khang H. N., et al.
Pubblicazione: (2025)
Mitigating Hallucinations on Object Attributes using Multiview Images and Negative Instructions
di: Tan, Zhijie, et al.
Pubblicazione: (2025)
di: Tan, Zhijie, et al.
Pubblicazione: (2025)
EDGE-Shield: Efficient Denoising-staGE Shield for Violative Content Filtering via Scalable Reference-Based Matching
di: Taniguchi, Takara, et al.
Pubblicazione: (2026)
di: Taniguchi, Takara, et al.
Pubblicazione: (2026)
SAGA: Learning Signal-Aligned Distributions for Improved Text-to-Image Generation
di: Grimal, Paul, et al.
Pubblicazione: (2025)
di: Grimal, Paul, et al.
Pubblicazione: (2025)
GoDe: Gaussians on Demand for Progressive Level of Detail and Scalable Compression
di: Di Sario, Francesco, et al.
Pubblicazione: (2025)
di: Di Sario, Francesco, et al.
Pubblicazione: (2025)
PANDORA: Pixel-wise Attention Dissolution and Latent Guidance for Zero-Shot Object Removal
di: Vo, Dinh-Khoi, et al.
Pubblicazione: (2026)
di: Vo, Dinh-Khoi, et al.
Pubblicazione: (2026)
Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?
di: Thakkar, Parth, et al.
Pubblicazione: (2025)
di: Thakkar, Parth, et al.
Pubblicazione: (2025)
Anatomical Attention Alignment representation for Radiology Report Generation
di: Nguyen, Quang Vinh, et al.
Pubblicazione: (2025)
di: Nguyen, Quang Vinh, et al.
Pubblicazione: (2025)
Harnessing the Latent Diffusion Model for Training-Free Image Style Transfer
di: Masui, Kento, et al.
Pubblicazione: (2024)
di: Masui, Kento, et al.
Pubblicazione: (2024)
MureObjectStitch: Multi-reference Image Composition
di: Chen, Jiaxuan, et al.
Pubblicazione: (2024)
di: Chen, Jiaxuan, et al.
Pubblicazione: (2024)
A Comprehensive Information-Decomposition Analysis of Large Vision-Language Models
di: Xiu, Lixin, et al.
Pubblicazione: (2026)
di: Xiu, Lixin, et al.
Pubblicazione: (2026)
REACT: Real-time Efficiency and Accuracy Compromise for Tradeoffs in Scene Graph Generation
di: Neau, Maëlic, et al.
Pubblicazione: (2024)
di: Neau, Maëlic, et al.
Pubblicazione: (2024)
Localizing Before Answering: A Hallucination Evaluation Benchmark for Grounded Medical Multimodal LLMs
di: Nguyen, Dung, et al.
Pubblicazione: (2025)
di: Nguyen, Dung, et al.
Pubblicazione: (2025)
MangaFlow: An End-to-End Agentic Framework for Controllable Story to Manga Generation
di: Wang, Muyao, et al.
Pubblicazione: (2026)
di: Wang, Muyao, et al.
Pubblicazione: (2026)
Follow-Your-Preference: Towards Preference-Aligned Image Inpainting
di: Shen, Yutao, et al.
Pubblicazione: (2025)
di: Shen, Yutao, et al.
Pubblicazione: (2025)
Enhancing Descriptive Captions with Visual Attributes for Multimodal Perception
di: Sun, Yanpeng, et al.
Pubblicazione: (2024)
di: Sun, Yanpeng, et al.
Pubblicazione: (2024)
Amodal Instance Segmentation with Diffusion Shape Prior Estimation
di: Tran, Minh, et al.
Pubblicazione: (2024)
di: Tran, Minh, et al.
Pubblicazione: (2024)
Material Fingerprinting: Identifying and Predicting Perceptual Attributes of Material Appearance
di: Filip, Jiri, et al.
Pubblicazione: (2024)
di: Filip, Jiri, et al.
Pubblicazione: (2024)
Object Navigation with Structure-Semantic Reasoning-Based Multi-level Map and Multimodal Decision-Making LLM
di: Yan, Chongshang, et al.
Pubblicazione: (2025)
di: Yan, Chongshang, et al.
Pubblicazione: (2025)
Can Multimodal LLMs do Visual Temporal Understanding and Reasoning? The answer is No!
di: Imam, Mohamed Fazli, et al.
Pubblicazione: (2025)
di: Imam, Mohamed Fazli, et al.
Pubblicazione: (2025)
ScriptHOI: Learning Scripted State Transitions for Open-Vocabulary Human-Object Interaction Detection
di: Nguyen, Minh Anh, et al.
Pubblicazione: (2026)
di: Nguyen, Minh Anh, et al.
Pubblicazione: (2026)
Response-Aware Multimodal Learning for Post-Treatment Visual Acuity Forecasting
di: Bui, Phuoc-Nguyen, et al.
Pubblicazione: (2026)
di: Bui, Phuoc-Nguyen, et al.
Pubblicazione: (2026)
GCE-Pose: Global Context Enhancement for Category-level Object Pose Estimation
di: Li, Weihang, et al.
Pubblicazione: (2025)
di: Li, Weihang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
EVCap: Retrieval-Augmented Image Captioning with External Visual-Name Memory for Open-World Comprehension
di: Li, Jiaxuan, et al.
Pubblicazione: (2023) -
Persistent Test-time Adaptation in Recurring Testing Scenarios
di: Hoang, Trung-Hieu, et al.
Pubblicazione: (2023) -
SAMURAI: Shape-Aware Multimodal Retrieval for 3D Object Identification
di: Vo, Dinh-Khoi, et al.
Pubblicazione: (2025) -
Interactive Masked Image Modeling for Multimodal Object Detection in Remote Sensing
di: Vu, Minh-Duc, et al.
Pubblicazione: (2024) -
TESO: Online Tracking of Essential Matrix by Stochastic Optimization
di: Moravec, Jaroslav, et al.
Pubblicazione: (2026)