Little Data, Big Impact: Privacy-Aware Visual Language Models via Minimal Tuning
Fuente:
arXiv
Guardado en:
| Autores principales: | Samson, Laurens, Barazani, Nimrod, Ghebreab, Sennay, Asano, Yuki M. |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Artifacts of Idiosyncracy in Global Street View Data
por: Alpherts, Tim, et al.
Publicado: (2025)
por: Alpherts, Tim, et al.
Publicado: (2025)
PIN: Positional Insert Unlocks Object Localisation Abilities in VLMs
por: Dorkenwald, Michael, et al.
Publicado: (2024)
por: Dorkenwald, Michael, et al.
Publicado: (2024)
EMPLACE: Self-Supervised Urban Scene Change Detection
por: Alpherts, Tim, et al.
Publicado: (2025)
por: Alpherts, Tim, et al.
Publicado: (2025)
Better Language Models Exhibit Higher Visual Alignment
por: Ruthardt, Jona, et al.
Publicado: (2024)
por: Ruthardt, Jona, et al.
Publicado: (2024)
CROC: Evaluating and Training T2I Metrics with Pseudo- and Human-Labeled Contrastive Robustness Checks
por: Leiter, Christoph, et al.
Publicado: (2025)
por: Leiter, Christoph, et al.
Publicado: (2025)
Task-Aware Resolution Optimization for Visual Large Language Models
por: Luo, Weiqing, et al.
Publicado: (2025)
por: Luo, Weiqing, et al.
Publicado: (2025)
Less is More: High-value Data Selection for Visual Instruction Tuning
por: Liu, Zikang, et al.
Publicado: (2024)
por: Liu, Zikang, et al.
Publicado: (2024)
Dynamic Embedding of Hierarchical Visual Features for Efficient Vision-Language Fine-Tuning
por: Wei, Xinyu, et al.
Publicado: (2025)
por: Wei, Xinyu, et al.
Publicado: (2025)
TuneVLSeg: Prompt Tuning Benchmark for Vision-Language Segmentation Models
por: Adhikari, Rabin, et al.
Publicado: (2024)
por: Adhikari, Rabin, et al.
Publicado: (2024)
Phoneme-Level Visual Speech Recognition via Point-Visual Fusion and Language Model Reconstruction
por: Teng, Matthew Kit Khinn, et al.
Publicado: (2025)
por: Teng, Matthew Kit Khinn, et al.
Publicado: (2025)
Granular Privacy Control for Geolocation with Vision Language Models
por: Mendes, Ethan, et al.
Publicado: (2024)
por: Mendes, Ethan, et al.
Publicado: (2024)
Seeing is Believing: Rich-Context Hallucination Detection for MLLMs via Backward Visual Grounding
por: Guo, Pinxue, et al.
Publicado: (2025)
por: Guo, Pinxue, et al.
Publicado: (2025)
Privacy-Aware Camera 2.0 Technical Report
por: Song, Huan, et al.
Publicado: (2026)
por: Song, Huan, et al.
Publicado: (2026)
SharpZO: Hybrid Sharpness-Aware Vision Language Model Prompt Tuning via Forward-Only Passes
por: Yang, Yifan, et al.
Publicado: (2025)
por: Yang, Yifan, et al.
Publicado: (2025)
Debiasing Multimodal Large Language Models via Noise-Aware Preference Optimization
por: Zhang, Zefeng, et al.
Publicado: (2025)
por: Zhang, Zefeng, et al.
Publicado: (2025)
Context-aware Visual Storytelling with Visual Prefix Tuning and Contrastive Learning
por: Song, Yingjin, et al.
Publicado: (2024)
por: Song, Yingjin, et al.
Publicado: (2024)
No Train, all Gain: Self-Supervised Gradients Improve Deep Frozen Representations
por: Simoncini, Walter, et al.
Publicado: (2024)
por: Simoncini, Walter, et al.
Publicado: (2024)
HyperLLaVA: Dynamic Visual and Language Expert Tuning for Multimodal Large Language Models
por: Zhang, Wenqiao, et al.
Publicado: (2024)
por: Zhang, Wenqiao, et al.
Publicado: (2024)
LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning
por: You, Zebin, et al.
Publicado: (2025)
por: You, Zebin, et al.
Publicado: (2025)
Visual Representations inside the Language Model
por: Liu, Benlin, et al.
Publicado: (2025)
por: Liu, Benlin, et al.
Publicado: (2025)
Small Drafts, Big Verdict: Information-Intensive Visual Reasoning via Speculation
por: Liu, Yuhan, et al.
Publicado: (2025)
por: Liu, Yuhan, et al.
Publicado: (2025)
Vision Language Models Map Logos to Text via Semantic Entanglement in the Visual Projector
por: Li, Sifan, et al.
Publicado: (2025)
por: Li, Sifan, et al.
Publicado: (2025)
What Makes for Good Visual Instructions? Synthesizing Complex Visual Reasoning Instructions for Visual Instruction Tuning
por: Du, Yifan, et al.
Publicado: (2023)
por: Du, Yifan, et al.
Publicado: (2023)
Getting More Juice Out of Your Data: Hard Pair Refinement Enhances Visual-Language Models Without Extra Data
por: Wang, Haonan, et al.
Publicado: (2023)
por: Wang, Haonan, et al.
Publicado: (2023)
Do Vision-Language Models Really Understand Visual Language?
por: Hou, Yifan, et al.
Publicado: (2024)
por: Hou, Yifan, et al.
Publicado: (2024)
Clean Evaluations on Contaminated Visual Language Models
por: Lu, Hongyuan, et al.
Publicado: (2024)
por: Lu, Hongyuan, et al.
Publicado: (2024)
Grounding Language Models for Visual Entity Recognition
por: Xiao, Zilin, et al.
Publicado: (2024)
por: Xiao, Zilin, et al.
Publicado: (2024)
Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models
por: Hu, Yushi, et al.
Publicado: (2024)
por: Hu, Yushi, et al.
Publicado: (2024)
RoVRM: A Robust Visual Reward Model Optimized via Auxiliary Textual Preference Data
por: Wang, Chenglong, et al.
Publicado: (2024)
por: Wang, Chenglong, et al.
Publicado: (2024)
PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction
por: Xing, Long, et al.
Publicado: (2024)
por: Xing, Long, et al.
Publicado: (2024)
Scalable Vision Language Model Training via High Quality Data Curation
por: Dong, Hongyuan, et al.
Publicado: (2025)
por: Dong, Hongyuan, et al.
Publicado: (2025)
Survey of Cultural Awareness in Language Models: Text and Beyond
por: Pawar, Siddhesh, et al.
Publicado: (2024)
por: Pawar, Siddhesh, et al.
Publicado: (2024)
LayoutLLM: Layout Instruction Tuning with Large Language Models for Document Understanding
por: Luo, Chuwei, et al.
Publicado: (2024)
por: Luo, Chuwei, et al.
Publicado: (2024)
Do Vision-Language Models Understand Visual Persuasiveness?
por: Park, Gyuwon
Publicado: (2025)
por: Park, Gyuwon
Publicado: (2025)
Visual In-Context Learning for Large Vision-Language Models
por: Zhou, Yucheng, et al.
Publicado: (2024)
por: Zhou, Yucheng, et al.
Publicado: (2024)
Watch Out Your Album! On the Inadvertent Privacy Memorization in Multi-Modal Large Language Models
por: Ju, Tianjie, et al.
Publicado: (2025)
por: Ju, Tianjie, et al.
Publicado: (2025)
Visually Grounded Speech Models for Low-resource Languages and Cognitive Modelling
por: Nortje, Leanne
Publicado: (2024)
por: Nortje, Leanne
Publicado: (2024)
Vision-Flan: Scaling Human-Labeled Tasks in Visual Instruction Tuning
por: Xu, Zhiyang, et al.
Publicado: (2024)
por: Xu, Zhiyang, et al.
Publicado: (2024)
Constructing Multilingual Visual-Text Datasets Revealing Visual Multilingual Ability of Vision Language Models
por: Atuhurra, Jesse, et al.
Publicado: (2024)
por: Atuhurra, Jesse, et al.
Publicado: (2024)
Diagnosing Bottlenecks in Data Visualization Understanding by Vision-Language Models
por: Tartaglini, Alexa R., et al.
Publicado: (2025)
por: Tartaglini, Alexa R., et al.
Publicado: (2025)
Ejemplares similares
-
Artifacts of Idiosyncracy in Global Street View Data
por: Alpherts, Tim, et al.
Publicado: (2025) -
PIN: Positional Insert Unlocks Object Localisation Abilities in VLMs
por: Dorkenwald, Michael, et al.
Publicado: (2024) -
EMPLACE: Self-Supervised Urban Scene Change Detection
por: Alpherts, Tim, et al.
Publicado: (2025) -
Better Language Models Exhibit Higher Visual Alignment
por: Ruthardt, Jona, et al.
Publicado: (2024) -
CROC: Evaluating and Training T2I Metrics with Pseudo- and Human-Labeled Contrastive Robustness Checks
por: Leiter, Christoph, et al.
Publicado: (2025)