T2Vs Meet VLMs: A Scalable Multimodal Dataset for Visual Harmfulness Recognition
Fuente:
arXiv
Guardado en:
| Autores principales: | Yeh, Chen, Chang, You-Ming, Chiu, Wei-Chen, Yu, Ning |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
AntifakePrompt: Prompt-Tuned Vision-Language Models are Fake Image Detectors
por: Chang, You-Ming, et al.
Publicado: (2023)
por: Chang, You-Ming, et al.
Publicado: (2023)
ColorSense: A Study on Color Vision in Machine Visual Recognition
por: Chiu, Ming-Chang, et al.
Publicado: (2022)
por: Chiu, Ming-Chang, et al.
Publicado: (2022)
Benchmarking Badminton Action Recognition with a New Fine-Grained Dataset
por: Li, Qi, et al.
Publicado: (2024)
por: Li, Qi, et al.
Publicado: (2024)
MMIS: Multimodal Dataset for Interior Scene Visual Generation and Recognition
por: Kassab, Hozaifa, et al.
Publicado: (2024)
por: Kassab, Hozaifa, et al.
Publicado: (2024)
ETC: Extreme Token Compression via Task-aware Visual Information Distillation in VLMs
por: Gao, Yiling, et al.
Publicado: (2026)
por: Gao, Yiling, et al.
Publicado: (2026)
Starve to Perceive: Taming Lazy Perception in VLMs with Constrained Visual Bandwidth
por: Wu, Yuhuan, et al.
Publicado: (2026)
por: Wu, Yuhuan, et al.
Publicado: (2026)
When Data Manipulation Meets Attack Goals: An In-depth Survey of Attacks for VLMs
por: Dai, Aobotao, et al.
Publicado: (2025)
por: Dai, Aobotao, et al.
Publicado: (2025)
A Visual Question Answering Method for SAR Ship: Breaking the Requirement for Multimodal Dataset Construction and Model Fine-Tuning
por: Wang, Fei, et al.
Publicado: (2024)
por: Wang, Fei, et al.
Publicado: (2024)
Does Your 3D Encoder Really Work? When Pretrain-SFT from 2D VLMs Meets 3D VLMs
por: Li, Haoyuan, et al.
Publicado: (2025)
por: Li, Haoyuan, et al.
Publicado: (2025)
MMTok: Multimodal Coverage Maximization for Efficient Inference of VLMs
por: Dong, Sixun, et al.
Publicado: (2025)
por: Dong, Sixun, et al.
Publicado: (2025)
Exemplar Masking for Multimodal Incremental Learning
por: Lee, Yi-Lun, et al.
Publicado: (2024)
por: Lee, Yi-Lun, et al.
Publicado: (2024)
Benchmarking In-the-wild Multimodal Disease Recognition and A Versatile Baseline
por: Wei, Tianqi, et al.
Publicado: (2024)
por: Wei, Tianqi, et al.
Publicado: (2024)
DDI-CoCo: A Dataset For Understanding The Effect Of Color Contrast In Machine-Assisted Skin Disease Detection
por: Chiu, Ming-Chang, et al.
Publicado: (2024)
por: Chiu, Ming-Chang, et al.
Publicado: (2024)
ToddlerAct: A Toddler Action Recognition Dataset for Gross Motor Development Assessment
por: Huang, Hsiang-Wei, et al.
Publicado: (2024)
por: Huang, Hsiang-Wei, et al.
Publicado: (2024)
Tell Me Where You Are: Multimodal LLMs Meet Place Recognition
por: Lyu, Zonglin, et al.
Publicado: (2024)
por: Lyu, Zonglin, et al.
Publicado: (2024)
Probing the Reliability of Driving VLMs: From Inconsistent Responses to Grounded Temporal Reasoning
por: Chang, Chun-Peng, et al.
Publicado: (2026)
por: Chang, Chun-Peng, et al.
Publicado: (2026)
Image Recognition with Vision and Language Embeddings of VLMs
por: Volkov, Illia, et al.
Publicado: (2025)
por: Volkov, Illia, et al.
Publicado: (2025)
ViTaL: A Multimodality Dataset and Benchmark for Multi-pathological Ovarian Tumor Recognition
por: Zhou, You, et al.
Publicado: (2025)
por: Zhou, You, et al.
Publicado: (2025)
Semantic Change Detection of Roads and Bridges: A Fine-grained Dataset and Multimodal Frequency-driven Detector
por: Shu, Qingling, et al.
Publicado: (2025)
por: Shu, Qingling, et al.
Publicado: (2025)
ABC: Achieving Better Control of Multimodal Embeddings using VLMs
por: Schneider, Benjamin, et al.
Publicado: (2025)
por: Schneider, Benjamin, et al.
Publicado: (2025)
VACoT: Rethinking Visual Data Augmentation with VLMs
por: Xu, Zhengzhuo, et al.
Publicado: (2025)
por: Xu, Zhengzhuo, et al.
Publicado: (2025)
Beyond Shortcuts: Mitigating Visual Illusions in Frozen VLMs via Qualitative Reasoning
por: Guo, Hao, et al.
Publicado: (2026)
por: Guo, Hao, et al.
Publicado: (2026)
Feature-Based Dual Visual Feature Extraction Model for Compound Multimodal Emotion Recognition
por: Liu, Ran, et al.
Publicado: (2025)
por: Liu, Ran, et al.
Publicado: (2025)
Road Rage Reasoning with Vision-language Models (VLMs): Task Definition and Evaluation Dataset
por: Weng, Yibing, et al.
Publicado: (2025)
por: Weng, Yibing, et al.
Publicado: (2025)
CoMM: A Coherent Interleaved Image-Text Dataset for Multimodal Understanding and Generation
por: Chen, Wei, et al.
Publicado: (2024)
por: Chen, Wei, et al.
Publicado: (2024)
Boost Self-Supervised Dataset Distillation via Parameterization, Predefined Augmentation, and Approximation
por: Yu, Sheng-Feng, et al.
Publicado: (2025)
por: Yu, Sheng-Feng, et al.
Publicado: (2025)
Agentic Discovery with Active Hypothesis Exploration for Visual Recognition
por: Koo, Jaywon, et al.
Publicado: (2026)
por: Koo, Jaywon, et al.
Publicado: (2026)
Beyond Visual Safety: Jailbreaking Multimodal Large Language Models for Harmful Image Generation via Semantic-Agnostic Inputs
por: Yu, Mingyu, et al.
Publicado: (2026)
por: Yu, Mingyu, et al.
Publicado: (2026)
StealthAttack: Robust 3D Gaussian Splatting Poisoning via Density-Guided Illusions
por: Ke, Bo-Hsu, et al.
Publicado: (2025)
por: Ke, Bo-Hsu, et al.
Publicado: (2025)
2D Gaussians Meet Visual Tokenizer
por: Shi, Yiang, et al.
Publicado: (2025)
por: Shi, Yiang, et al.
Publicado: (2025)
UHR-Micro: Diagnosing and Mitigating the Resolution Illusion in Earth Observation VLMs
por: Ni, Shuo, et al.
Publicado: (2026)
por: Ni, Shuo, et al.
Publicado: (2026)
Autoregressive Semantic Visual Reconstruction Helps VLMs Understand Better
por: Wang, Dianyi, et al.
Publicado: (2025)
por: Wang, Dianyi, et al.
Publicado: (2025)
Towards Comprehensive Multimodal Perception: Introducing the Touch-Language-Vision Dataset
por: Cheng, Ning, et al.
Publicado: (2024)
por: Cheng, Ning, et al.
Publicado: (2024)
NYC-Indoor-VPR: A Long-Term Indoor Visual Place Recognition Dataset with Semi-Automatic Annotation
por: Sheng, Diwei, et al.
Publicado: (2024)
por: Sheng, Diwei, et al.
Publicado: (2024)
NYC-Event-VPR: A Large-Scale High-Resolution Event-Based Visual Place Recognition Dataset in Dense Urban Environments
por: Pan, Taiyi, et al.
Publicado: (2024)
por: Pan, Taiyi, et al.
Publicado: (2024)
Flexible and Efficient Spatio-Temporal Transformer for Sequential Visual Place Recognition
por: Kiu, Yu, et al.
Publicado: (2025)
por: Kiu, Yu, et al.
Publicado: (2025)
LLMs Meet VLMs: Boost Open Vocabulary Object Detection with Fine-grained Descriptors
por: Jin, Sheng, et al.
Publicado: (2024)
por: Jin, Sheng, et al.
Publicado: (2024)
When Visual Privacy Protection Meets Multimodal Large Language Models
por: Hui, Xiaofei, et al.
Publicado: (2026)
por: Hui, Xiaofei, et al.
Publicado: (2026)
Customized Visual Storytelling with Unified Multimodal LLMs
por: Li, Wei-Hua, et al.
Publicado: (2026)
por: Li, Wei-Hua, et al.
Publicado: (2026)
A Survey on Interpretability in Visual Recognition
por: Wan, Qiyang, et al.
Publicado: (2025)
por: Wan, Qiyang, et al.
Publicado: (2025)
Ejemplares similares
-
AntifakePrompt: Prompt-Tuned Vision-Language Models are Fake Image Detectors
por: Chang, You-Ming, et al.
Publicado: (2023) -
ColorSense: A Study on Color Vision in Machine Visual Recognition
por: Chiu, Ming-Chang, et al.
Publicado: (2022) -
Benchmarking Badminton Action Recognition with a New Fine-Grained Dataset
por: Li, Qi, et al.
Publicado: (2024) -
MMIS: Multimodal Dataset for Interior Scene Visual Generation and Recognition
por: Kassab, Hozaifa, et al.
Publicado: (2024) -
ETC: Extreme Token Compression via Task-aware Visual Information Distillation in VLMs
por: Gao, Yiling, et al.
Publicado: (2026)