Probing Commonsense Reasoning Capability of Text-to-Image Generative Models via Non-visual Description
Fuente:
arXiv
Salvato in:
| Autori principali: | Pan, Mianzhi, Li, Jianfei, Yu, Mingyue, Ma, Zheng, Cheng, Kanzhi, Zhang, Jianbing, Chen, Jiajun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues
di: Zhou, Dingkun, et al.
Pubblicazione: (2025)
di: Zhou, Dingkun, et al.
Pubblicazione: (2025)
RFNNS: Robust Fixed Neural Network Steganography with Universal Text-to-Image Models
di: Cheng, Yu, et al.
Pubblicazione: (2025)
di: Cheng, Yu, et al.
Pubblicazione: (2025)
Causal Debiasing for Visual Commonsense Reasoning
di: Zou, Jiayi, et al.
Pubblicazione: (2025)
di: Zou, Jiayi, et al.
Pubblicazione: (2025)
Visual Semantic Description Generation with MLLMs for Image-Text Matching
di: Chen, Junyu, et al.
Pubblicazione: (2025)
di: Chen, Junyu, et al.
Pubblicazione: (2025)
TIP and Polish: Text-Image-Prototype Guided Multi-Modal Generation via Commonality-Discrepancy Modeling and Refinement
di: Ma, Zhiyong, et al.
Pubblicazione: (2025)
di: Ma, Zhiyong, et al.
Pubblicazione: (2025)
REAL: Realism Evaluation of Text-to-Image Generation Models for Effective Data Augmentation
di: Li, Ran, et al.
Pubblicazione: (2025)
di: Li, Ran, et al.
Pubblicazione: (2025)
Relationship Analysis of Image-Text Pair in SNS Posts
di: Nabeoka, Takuto, et al.
Pubblicazione: (2025)
di: Nabeoka, Takuto, et al.
Pubblicazione: (2025)
Visual Autoregressive Modeling for Instruction-Guided Image Editing
di: Mao, Qingyang, et al.
Pubblicazione: (2025)
di: Mao, Qingyang, et al.
Pubblicazione: (2025)
Hearing from Silence: Reasoning Audio Descriptions from Silent Videos via Vision-Language Model
di: Ren, Yong, et al.
Pubblicazione: (2025)
di: Ren, Yong, et al.
Pubblicazione: (2025)
Discriminative Probing and Tuning for Text-to-Image Generation
di: Qu, Leigang, et al.
Pubblicazione: (2024)
di: Qu, Leigang, et al.
Pubblicazione: (2024)
CAMERA: Adapting to Semantic Camouflage in Unsupervised Text-Attributed Graph Fraud Detection
di: Pan, Junjun, et al.
Pubblicazione: (2026)
di: Pan, Junjun, et al.
Pubblicazione: (2026)
Interpreting Multimodal Communication at Scale in Short-Form Video: Visual, Audio, and Textual Mental Health Discourse on TikTok
di: Zha, Mingyue, et al.
Pubblicazione: (2026)
di: Zha, Mingyue, et al.
Pubblicazione: (2026)
Towards Better Text-to-Image Generation Alignment via Attention Modulation
di: Wu, Yihang, et al.
Pubblicazione: (2024)
di: Wu, Yihang, et al.
Pubblicazione: (2024)
Omni2Sound: Towards Unified Video-Text-to-Audio Generation
di: Dai, Yusheng, et al.
Pubblicazione: (2026)
di: Dai, Yusheng, et al.
Pubblicazione: (2026)
Towards Alleviating Text-to-Image Retrieval Hallucination for CLIP in Zero-shot Learning
di: Wang, Hanyao, et al.
Pubblicazione: (2024)
di: Wang, Hanyao, et al.
Pubblicazione: (2024)
MMC: Iterative Refinement of VLM Reasoning via MCTS-based Multimodal Critique
di: Liu, Shuhang, et al.
Pubblicazione: (2025)
di: Liu, Shuhang, et al.
Pubblicazione: (2025)
Generating Digital Models Using Text-to-3D and Image-to-3D Prompts: Critical Case Study
di: Ziatdinov, Rushan, et al.
Pubblicazione: (2025)
di: Ziatdinov, Rushan, et al.
Pubblicazione: (2025)
SCI-Reason: A Dataset with Chain-of-Thought Rationales for Complex Multimodal Reasoning in Academic Areas
di: Ma, Chenghao, et al.
Pubblicazione: (2025)
di: Ma, Chenghao, et al.
Pubblicazione: (2025)
Synthetic Perception: Can Generated Images Unlock Latent Visual Prior for Text-Centric Reasoning?
di: Huang, Yuesheng, et al.
Pubblicazione: (2025)
di: Huang, Yuesheng, et al.
Pubblicazione: (2025)
VSpeechLM: A Visual Speech Language Model for Visual Text-to-Speech Task
di: Wang, Yuyue, et al.
Pubblicazione: (2025)
di: Wang, Yuyue, et al.
Pubblicazione: (2025)
Human-centered Interactive Learning via MLLMs for Text-to-Image Person Re-identification
di: Qin, Yang, et al.
Pubblicazione: (2025)
di: Qin, Yang, et al.
Pubblicazione: (2025)
ConvBench: A Multi-Turn Conversation Evaluation Benchmark with Hierarchical Capability for Large Vision-Language Models
di: Liu, Shuo, et al.
Pubblicazione: (2024)
di: Liu, Shuo, et al.
Pubblicazione: (2024)
Identity-Preserving Text-to-Video Generation via Training-Free Prompt, Image, and Guidance Enhancement
di: Gao, Jiayi, et al.
Pubblicazione: (2025)
di: Gao, Jiayi, et al.
Pubblicazione: (2025)
GTLR-GS: Geometry-Texture Aware LiDAR-Regularized 3D Gaussian Splatting for Realistic Scene Reconstruction
di: Fang, Yan, et al.
Pubblicazione: (2026)
di: Fang, Yan, et al.
Pubblicazione: (2026)
DiffuseST: Unleashing the Capability of the Diffusion Model for Style Transfer
di: Hu, Ying, et al.
Pubblicazione: (2024)
di: Hu, Ying, et al.
Pubblicazione: (2024)
Dark Side of Modalities: Reinforced Multimodal Distillation for Multimodal Knowledge Graph Reasoning
di: Zhao, Yu, et al.
Pubblicazione: (2025)
di: Zhao, Yu, et al.
Pubblicazione: (2025)
Can LLMs "Reason" in Music? An Evaluation of LLMs' Capability of Music Understanding and Generation
di: Zhou, Ziya, et al.
Pubblicazione: (2024)
di: Zhou, Ziya, et al.
Pubblicazione: (2024)
ImageScope: Unifying Language-Guided Image Retrieval via Large Multimodal Model Collective Reasoning
di: Luo, Pengfei, et al.
Pubblicazione: (2025)
di: Luo, Pengfei, et al.
Pubblicazione: (2025)
The Interspeech 2026 Audio Reasoning Challenge: Evaluating Reasoning Process Quality for Audio Reasoning Models and Agents
di: Ma, Ziyang, et al.
Pubblicazione: (2026)
di: Ma, Ziyang, et al.
Pubblicazione: (2026)
Augmenting Intra-Modal Understanding in MLLMs for Robust Multimodal Keyphrase Generation
di: Cao, Jiajun, et al.
Pubblicazione: (2025)
di: Cao, Jiajun, et al.
Pubblicazione: (2025)
Controllable Text-to-Speech Synthesis with Masked-Autoencoded Style-Rich Representation
di: Wang, Yongqi, et al.
Pubblicazione: (2025)
di: Wang, Yongqi, et al.
Pubblicazione: (2025)
MIDI-LLM: Adapting Large Language Models for Text-to-MIDI Music Generation
di: Wu, Shih-Lun, et al.
Pubblicazione: (2025)
di: Wu, Shih-Lun, et al.
Pubblicazione: (2025)
FakeBench: Probing Explainable Fake Image Detection via Large Multimodal Models
di: Li, Yixuan, et al.
Pubblicazione: (2024)
di: Li, Yixuan, et al.
Pubblicazione: (2024)
G-Refine: A General Quality Refiner for Text-to-Image Generation
di: Li, Chunyi, et al.
Pubblicazione: (2024)
di: Li, Chunyi, et al.
Pubblicazione: (2024)
Exploring Phrase-Level Grounding with Text-to-Image Diffusion Model
di: Yang, Danni, et al.
Pubblicazione: (2024)
di: Yang, Danni, et al.
Pubblicazione: (2024)
Virbo: Multimodal Multilingual Avatar Video Generation in Digital Marketing
di: Zhang, Juan, et al.
Pubblicazione: (2024)
di: Zhang, Juan, et al.
Pubblicazione: (2024)
On Copyright Risks of Text-to-Image Diffusion Models
di: Zhang, Yang, et al.
Pubblicazione: (2023)
di: Zhang, Yang, et al.
Pubblicazione: (2023)
Investigating Conceptual Blending of a Diffusion Model for Improving Nonword-to-Image Generation
di: Matsuhira, Chihaya, et al.
Pubblicazione: (2024)
di: Matsuhira, Chihaya, et al.
Pubblicazione: (2024)
DreamMesh: Jointly Manipulating and Texturing Triangle Meshes for Text-to-3D Generation
di: Yang, Haibo, et al.
Pubblicazione: (2024)
di: Yang, Haibo, et al.
Pubblicazione: (2024)
P2P: Automated Paper-to-Poster Generation and Fine-Grained Benchmark
di: Sun, Tao, et al.
Pubblicazione: (2025)
di: Sun, Tao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues
di: Zhou, Dingkun, et al.
Pubblicazione: (2025) -
RFNNS: Robust Fixed Neural Network Steganography with Universal Text-to-Image Models
di: Cheng, Yu, et al.
Pubblicazione: (2025) -
Causal Debiasing for Visual Commonsense Reasoning
di: Zou, Jiayi, et al.
Pubblicazione: (2025) -
Visual Semantic Description Generation with MLLMs for Image-Text Matching
di: Chen, Junyu, et al.
Pubblicazione: (2025) -
TIP and Polish: Text-Image-Prototype Guided Multi-Modal Generation via Commonality-Discrepancy Modeling and Refinement
di: Ma, Zhiyong, et al.
Pubblicazione: (2025)