RefVNLI: Towards Scalable Evaluation of Subject-driven Text-to-image Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Slobodkin, Aviv, Taitelbaum, Hagai, Bitton, Yonatan, Gordon, Brian, Sokolik, Michal, Guetta, Nitzan Bitton, Gueta, Almog, Rassin, Royi, Lischinski, Dani, Szpektor, Idan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Visual Riddles: a Commonsense and World Knowledge Challenge for Large Vision and Language Models
par: Bitton-Guetta, Nitzan, et autres
Publié: (2024)
par: Bitton-Guetta, Nitzan, et autres
Publié: (2024)
Mismatch Quest: Visual and Textual Feedback for Image-Text Misalignment
par: Gordon, Brian, et autres
Publié: (2023)
par: Gordon, Brian, et autres
Publié: (2023)
EditInspector: A Benchmark for Evaluation of Text-Guided Image Edits
par: Yosef, Ron, et autres
Publié: (2025)
par: Yosef, Ron, et autres
Publié: (2025)
Contrastive Sequential-Diffusion Learning: Non-linear and Multi-Scene Instructional Video Synthesis
par: Ramos, Vasco, et autres
Publié: (2024)
par: Ramos, Vasco, et autres
Publié: (2024)
GRADE: Quantifying Sample Diversity in Text-to-Image Models
par: Rassin, Royi, et autres
Publié: (2024)
par: Rassin, Royi, et autres
Publié: (2024)
Bridging the Visual Gap: Fine-Tuning Multimodal Models with Knowledge-Adapted Captions
par: Yanuka, Moran, et autres
Publié: (2024)
par: Yanuka, Moran, et autres
Publié: (2024)
Video-STaR: Self-Training Enables Video Instruction Tuning with Any Supervision
par: Zohar, Orr, et autres
Publié: (2024)
par: Zohar, Orr, et autres
Publié: (2024)
TALC: Time-Aligned Captions for Multi-Scene Text-to-Video Generation
par: Bansal, Hritik, et autres
Publié: (2024)
par: Bansal, Hritik, et autres
Publié: (2024)
Unblocking Fine-Grained Evaluation of Detailed Captions: An Explaining AutoRater and Critic-and-Revise Pipeline
par: Gordon, Brian, et autres
Publié: (2025)
par: Gordon, Brian, et autres
Publié: (2025)
Seeing Isn't Knowing: Do VLMs Know When Not to Answer Spatial Questions (and Why)?
par: Zhang, Yue, et autres
Publié: (2026)
par: Zhang, Yue, et autres
Publié: (2026)
Generating Coherent Sequences of Visual Illustrations for Real-World Manual Tasks
par: Bordalo, João, et autres
Publié: (2024)
par: Bordalo, João, et autres
Publié: (2024)
Error-Driven Scene Editing for 3D Grounding in Large Language Models
par: Zhang, Yue, et autres
Publié: (2025)
par: Zhang, Yue, et autres
Publié: (2025)
ParallelPARC: A Scalable Pipeline for Generating Natural-Language Analogies
par: Sultan, Oren, et autres
Publié: (2024)
par: Sultan, Oren, et autres
Publié: (2024)
Detecting Stylistic Fingerprints of Large Language Models
par: Bitton, Yehonatan, et autres
Publié: (2025)
par: Bitton, Yehonatan, et autres
Publié: (2025)
Security Steerability is All You Need
par: Hazan, Itay, et autres
Publié: (2025)
par: Hazan, Itay, et autres
Publié: (2025)
There Are Only 24 Hours in a Day: Mitigating Issues of Access to Community Service Opportunities for College Students
par: Adrian L. Bitton
Publié: (2025)
par: Adrian L. Bitton
Publié: (2025)
Advanced small-cell ovarian carcinoma, hypercalcemic type: a challenging therapeutic entity
par: Rafael Caparica Bitton
Publié: (2014)
par: Rafael Caparica Bitton
Publié: (2014)
Pulmonary nodules: a challenging diagnosis during the follow up of cancer patients
par: Rafael Caparica Bitton
Publié: (2015)
par: Rafael Caparica Bitton
Publié: (2015)
3DLLM-Mem: Long-Term Spatial-Temporal Memory for Embodied 3D Large Language Model
par: Hu, Wenbo, et autres
Publié: (2025)
par: Hu, Wenbo, et autres
Publié: (2025)
Blended-NeRF: Zero-Shot Object Generation and Blending in Existing Neural Radiance Fields
par: Gordon, Ori, et autres
Publié: (2023)
par: Gordon, Ori, et autres
Publié: (2023)
Distinguishing Ignorance from Error in LLM Hallucinations
par: Simhi, Adi, et autres
Publié: (2024)
par: Simhi, Adi, et autres
Publié: (2024)
Constructing Benchmarks and Interventions for Combating Hallucinations in LLMs
par: Simhi, Adi, et autres
Publié: (2024)
par: Simhi, Adi, et autres
Publié: (2024)
Unveiling the Impact of the Electrolyte's Counter Ions on Organic Electrochemical Transistor Performance
par: Sapir Bitton, et autres
Publié: (2024)
par: Sapir Bitton, et autres
Publié: (2024)
Does the palpebral morphology influence the tear meniscus height between Caucasian and Asian eyes?
par: Maëlys Guinel, et autres
Publié: (2024)
par: Maëlys Guinel, et autres
Publié: (2024)
Direct comparison of multi-ion optical clocks based on $^{40}$Ca$^+$ and $^{88}$Sr$^+$
par: Sokolik, Yosef, et autres
Publié: (2026)
par: Sokolik, Yosef, et autres
Publié: (2026)
Editor's Choice: Evaluating Abstract Intent in Image Editing through Atomic Entity Analysis
par: Ventura, Mor, et autres
Publié: (2026)
par: Ventura, Mor, et autres
Publié: (2026)
KITTEN: A Knowledge-Intensive Evaluation of Image Generation on Visual Entities
par: Huang, Hsin-Ping, et autres
Publié: (2024)
par: Huang, Hsin-Ping, et autres
Publié: (2024)
Sex Work and Sexual Victimization: A Comparative Study of Students’ and Police Officers’ Perceptions of Sex‐Working Rape Victims
par: Liza Zvi, et autres
Publié: (2025)
par: Liza Zvi, et autres
Publié: (2025)
Fitness and Overfitness: Implicit Regularization in Evolutionary Dynamics
par: Rappeport, Hagai, et autres
Publié: (2025)
par: Rappeport, Hagai, et autres
Publié: (2025)
Seed-to-Seed: Image Translation in Diffusion Seed Space
par: Greenberg, Or, et autres
Publié: (2024)
par: Greenberg, Or, et autres
Publié: (2024)
Here Comes The AI Worm: Unleashing Zero-click Worms that Target GenAI-Powered Applications
par: Cohen, Stav, et autres
Publié: (2024)
par: Cohen, Stav, et autres
Publié: (2024)
A Jailbroken GenAI Model Can Cause Substantial Harm: GenAI-powered Applications are Vulnerable to PromptWares
par: Cohen, Stav, et autres
Publié: (2024)
par: Cohen, Stav, et autres
Publié: (2024)
Unleashing Worms and Extracting Data: Escalating the Outcome of Attacks against RAG-based Inference in Scale and Severity Using Jailbreaking
par: Cohen, Stav, et autres
Publié: (2024)
par: Cohen, Stav, et autres
Publié: (2024)
NL-Eye: Abductive NLI for Images
par: Ventura, Mor, et autres
Publié: (2024)
par: Ventura, Mor, et autres
Publié: (2024)
Make It Count: Text-to-Image Generation with an Accurate Number of Objects
par: Binyamin, Lital, et autres
Publié: (2024)
par: Binyamin, Lital, et autres
Publié: (2024)
Linguistic Binding in Diffusion Models: Enhancing Attribute Correspondence through Attention Map Alignment
par: Rassin, Royi, et autres
Publié: (2023)
par: Rassin, Royi, et autres
Publié: (2023)
ManagerBench: Evaluating the Safety-Pragmatism Trade-off in Autonomous LLMs
par: Simhi, Adi, et autres
Publié: (2025)
par: Simhi, Adi, et autres
Publié: (2025)
VideoPhy-2: A Challenging Action-Centric Physical Commonsense Evaluation in Video Generation
par: Bansal, Hritik, et autres
Publié: (2025)
par: Bansal, Hritik, et autres
Publié: (2025)
Click2Mask: Local Editing with Dynamic Mask Generation
par: Regev, Omer, et autres
Publié: (2024)
par: Regev, Omer, et autres
Publié: (2024)
Can LLMs Learn Macroeconomic Narratives from Social Media?
par: Gueta, Almog, et autres
Publié: (2024)
par: Gueta, Almog, et autres
Publié: (2024)
Documents similaires
-
Visual Riddles: a Commonsense and World Knowledge Challenge for Large Vision and Language Models
par: Bitton-Guetta, Nitzan, et autres
Publié: (2024) -
Mismatch Quest: Visual and Textual Feedback for Image-Text Misalignment
par: Gordon, Brian, et autres
Publié: (2023) -
EditInspector: A Benchmark for Evaluation of Text-Guided Image Edits
par: Yosef, Ron, et autres
Publié: (2025) -
Contrastive Sequential-Diffusion Learning: Non-linear and Multi-Scene Instructional Video Synthesis
par: Ramos, Vasco, et autres
Publié: (2024) -
GRADE: Quantifying Sample Diversity in Text-to-Image Models
par: Rassin, Royi, et autres
Publié: (2024)