Generative Human-Object Interaction Detection via Differentiable Cognitive Steering of Multi-modal LLMs
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Cai, Zhaolin, Duan, Huiyu, Xu, Zitong, Li, Fan, Liu, Zhi, Liu, Jing, Shen, Wei, Min, Xiongkuo, Zhai, Guangtao |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Steering and Rectifying Latent Representation Manifolds in Frozen Multi-modal LLMs for Video Anomaly Detection
von: Cai, Zhaolin, et al.
Veröffentlicht: (2026)
von: Cai, Zhaolin, et al.
Veröffentlicht: (2026)
ManipShield: A Unified Framework for Image Manipulation Detection, Localization and Explanation
von: Xu, Zitong, et al.
Veröffentlicht: (2025)
von: Xu, Zitong, et al.
Veröffentlicht: (2025)
Quality Assessment for AI Generated Images with Instruction Tuning
von: Wang, Jiarui, et al.
Veröffentlicht: (2024)
von: Wang, Jiarui, et al.
Veröffentlicht: (2024)
How is Visual Attention Influenced by Text Guidance? Database and Model
von: Sun, Yinan, et al.
Veröffentlicht: (2024)
von: Sun, Yinan, et al.
Veröffentlicht: (2024)
ReasonEdit: Towards Interpretable Image Editing Evaluation via Reinforcement Learning
von: Chen, Honghua, et al.
Veröffentlicht: (2026)
von: Chen, Honghua, et al.
Veröffentlicht: (2026)
VTONQA: A Multi-Dimensional Quality Assessment Dataset for Virtual Try-on
von: Wei, Xinyi, et al.
Veröffentlicht: (2026)
von: Wei, Xinyi, et al.
Veröffentlicht: (2026)
UniProcessor: A Text-induced Unified Low-level Image Processor
von: Duan, Huiyu, et al.
Veröffentlicht: (2024)
von: Duan, Huiyu, et al.
Veröffentlicht: (2024)
AIGV-Assessor: Benchmarking and Evaluating the Perceptual Quality of Text-to-Video Generation with LMM
von: Wang, Jiarui, et al.
Veröffentlicht: (2024)
von: Wang, Jiarui, et al.
Veröffentlicht: (2024)
Fine-Grained Human Pose Editing Assessment via Layer-Selective MLLMs
von: Sun, Ningyu, et al.
Veröffentlicht: (2026)
von: Sun, Ningyu, et al.
Veröffentlicht: (2026)
Preference-Guided Debiasing for No-Reference Enhancement Image Quality Assessment
von: Gao, Shiqi, et al.
Veröffentlicht: (2026)
von: Gao, Shiqi, et al.
Veröffentlicht: (2026)
LM Fight Arena: Benchmarking Large Multimodal Models via Game Competition
von: Zheng, Yushuo, et al.
Veröffentlicht: (2025)
von: Zheng, Yushuo, et al.
Veröffentlicht: (2025)
TDVE-Assessor: Benchmarking and Evaluating the Quality of Text-Driven Video Editing with LMMs
von: Wang, Juntong, et al.
Veröffentlicht: (2025)
von: Wang, Juntong, et al.
Veröffentlicht: (2025)
Perceptual Video Quality Assessment: A Survey
von: Min, Xiongkuo, et al.
Veröffentlicht: (2024)
von: Min, Xiongkuo, et al.
Veröffentlicht: (2024)
LMM4LMM: Benchmarking and Evaluating Large-multimodal Image Generation with LMMs
von: Wang, Jiarui, et al.
Veröffentlicht: (2025)
von: Wang, Jiarui, et al.
Veröffentlicht: (2025)
Multi-Dimensional Quality Assessment for Text-to-3D Assets: Dataset and Model
von: Fu, Kang, et al.
Veröffentlicht: (2025)
von: Fu, Kang, et al.
Veröffentlicht: (2025)
Facial Attractiveness Prediction in Live Streaming: A New Benchmark and Multi-modal Method
von: Li, Hui, et al.
Veröffentlicht: (2025)
von: Li, Hui, et al.
Veröffentlicht: (2025)
FineVQ: Fine-Grained User Generated Content Video Quality Assessment
von: Duan, Huiyu, et al.
Veröffentlicht: (2024)
von: Duan, Huiyu, et al.
Veröffentlicht: (2024)
Quality Assessment and Distortion-aware Saliency Prediction for AI-Generated Omnidirectional Images
von: Yang, Liu, et al.
Veröffentlicht: (2025)
von: Yang, Liu, et al.
Veröffentlicht: (2025)
Omni$^2$: Unifying Omnidirectional Image Generation and Editing in an Omni Model
von: Yang, Liu, et al.
Veröffentlicht: (2025)
von: Yang, Liu, et al.
Veröffentlicht: (2025)
ESIQA: Perceptual Quality Assessment of Vision-Pro-based Egocentric Spatial Images
von: Zhu, Xilei, et al.
Veröffentlicht: (2024)
von: Zhu, Xilei, et al.
Veröffentlicht: (2024)
MMHead: Towards Fine-grained Multi-modal 3D Facial Animation
von: Wu, Sijing, et al.
Veröffentlicht: (2024)
von: Wu, Sijing, et al.
Veröffentlicht: (2024)
TIT-Score: Evaluating Long-Prompt Based Text-to-Image Alignment via Text-to-Image-to-Text Consistency
von: Wang, Juntong, et al.
Veröffentlicht: (2025)
von: Wang, Juntong, et al.
Veröffentlicht: (2025)
Market-Bench: Benchmarking Large Language Models on Economic and Trade Competition
von: Zheng, Yushuo, et al.
Veröffentlicht: (2026)
von: Zheng, Yushuo, et al.
Veröffentlicht: (2026)
I2I-Bench: A Comprehensive Benchmark Suite for Image-to-Image Editing Models
von: Wang, Juntong, et al.
Veröffentlicht: (2025)
von: Wang, Juntong, et al.
Veröffentlicht: (2025)
DynT2I-Eval: A Dynamic Evaluation Framework for Text-to-Image Models
von: Wang, Juntong, et al.
Veröffentlicht: (2026)
von: Wang, Juntong, et al.
Veröffentlicht: (2026)
EEmo-Logic: A Unified Dataset and Multi-Stage Framework for Comprehensive Image-Evoked Emotion Assessment
von: Gao, Lancheng, et al.
Veröffentlicht: (2026)
von: Gao, Lancheng, et al.
Veröffentlicht: (2026)
Evaluating Image Editing with LLMs: A Comprehensive Benchmark and Intermediate-Layer Probing Approach
von: Gao, Shiqi, et al.
Veröffentlicht: (2026)
von: Gao, Shiqi, et al.
Veröffentlicht: (2026)
LMME3DHF: Benchmarking and Evaluating Multimodal 3D Human Face Generation with LMMs
von: Yang, Woo Yi, et al.
Veröffentlicht: (2025)
von: Yang, Woo Yi, et al.
Veröffentlicht: (2025)
HarmonyIQA: Pioneering Benchmark and Model for Image Harmonization Quality Assessment
von: Xu, Zitong, et al.
Veröffentlicht: (2025)
von: Xu, Zitong, et al.
Veröffentlicht: (2025)
AGHI-QA: A Subjective-Aligned Dataset and Metric for AI-Generated Human Images
von: Li, Yunhao, et al.
Veröffentlicht: (2025)
von: Li, Yunhao, et al.
Veröffentlicht: (2025)
ELIQ: A Label-Free Framework for Quality Assessment of Evolving AI-Generated Images
von: Li, Xinyue, et al.
Veröffentlicht: (2026)
von: Li, Xinyue, et al.
Veröffentlicht: (2026)
ESVQA: Perceptual Quality Assessment of Egocentric Spatial Videos
von: Zhu, Xilei, et al.
Veröffentlicht: (2024)
von: Zhu, Xilei, et al.
Veröffentlicht: (2024)
ODI-Bench: Can MLLMs Understand Immersive Omnidirectional Environments?
von: Yang, Liu, et al.
Veröffentlicht: (2025)
von: Yang, Liu, et al.
Veröffentlicht: (2025)
EditHF-1M: A Million-Scale Rich Human Preference Feedback for Image Editing
von: Xu, Zitong, et al.
Veröffentlicht: (2026)
von: Xu, Zitong, et al.
Veröffentlicht: (2026)
Textured Mesh Saliency: Bridging Geometry and Texture for Human Perception in 3D Graphics
von: Zhang, Kaiwei, et al.
Veröffentlicht: (2024)
von: Zhang, Kaiwei, et al.
Veröffentlicht: (2024)
Exploring Image Quality Assessment from a New Perspective: Pupil Size
von: Gao, Yixuan, et al.
Veröffentlicht: (2025)
von: Gao, Yixuan, et al.
Veröffentlicht: (2025)
AIGCOIQA2024: Perceptual Quality Assessment of AI Generated Omnidirectional Images
von: Yang, Liu, et al.
Veröffentlicht: (2024)
von: Yang, Liu, et al.
Veröffentlicht: (2024)
ITIScore: An Image-to-Text-to-Image Rating Framework for the Image Captioning Ability of MLLMs
von: Xu, Zitong, et al.
Veröffentlicht: (2026)
von: Xu, Zitong, et al.
Veröffentlicht: (2026)
RGC-VQA: An Exploration Database for Robotic-Generated Video Quality Assessment
von: Jin, Jianing, et al.
Veröffentlicht: (2025)
von: Jin, Jianing, et al.
Veröffentlicht: (2025)
Enhancing Image Quality Assessment Ability of LMMs via Retrieval-Augmented Generation
von: Fu, Kang, et al.
Veröffentlicht: (2026)
von: Fu, Kang, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Steering and Rectifying Latent Representation Manifolds in Frozen Multi-modal LLMs for Video Anomaly Detection
von: Cai, Zhaolin, et al.
Veröffentlicht: (2026) -
ManipShield: A Unified Framework for Image Manipulation Detection, Localization and Explanation
von: Xu, Zitong, et al.
Veröffentlicht: (2025) -
Quality Assessment for AI Generated Images with Instruction Tuning
von: Wang, Jiarui, et al.
Veröffentlicht: (2024) -
How is Visual Attention Influenced by Text Guidance? Database and Model
von: Sun, Yinan, et al.
Veröffentlicht: (2024) -
ReasonEdit: Towards Interpretable Image Editing Evaluation via Reinforcement Learning
von: Chen, Honghua, et al.
Veröffentlicht: (2026)