DOCCI: Descriptions of Connected and Contrasting Images
Fuente:
arXiv
Salvato in:
| Autori principali: | Onoe, Yasumasa, Rane, Sunayana, Berger, Zachary, Bitton, Yonatan, Cho, Jaemin, Garg, Roopal, Ku, Alexander, Parekh, Zarana, Pont-Tuset, Jordi, Tanzer, Garrett, Wang, Su, Baldridge, Jason |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ImageInWords: Unlocking Hyper-Detailed Image Descriptions
di: Garg, Roopal, et al.
Pubblicazione: (2024)
di: Garg, Roopal, et al.
Pubblicazione: (2024)
Davidsonian Scene Graph: Improving Reliability in Fine-grained Evaluation for Text-to-Image Generation
di: Cho, Jaemin, et al.
Pubblicazione: (2023)
di: Cho, Jaemin, et al.
Pubblicazione: (2023)
TECCI: Tricky Edits of Collected and Curated Images
di: Agrawal, Aishwarya, et al.
Pubblicazione: (2026)
di: Agrawal, Aishwarya, et al.
Pubblicazione: (2026)
The Reasonable Person Standard for AI
di: Rane, Sunayana
Pubblicazione: (2024)
di: Rane, Sunayana
Pubblicazione: (2024)
Unblocking Fine-Grained Evaluation of Detailed Captions: An Explaining AutoRater and Critic-and-Revise Pipeline
di: Gordon, Brian, et al.
Pubblicazione: (2025)
di: Gordon, Brian, et al.
Pubblicazione: (2025)
Greedy Growing Enables High-Resolution Pixel-Based Diffusion Models
di: Vasconcelos, Cristina N., et al.
Pubblicazione: (2024)
di: Vasconcelos, Cristina N., et al.
Pubblicazione: (2024)
Mismatch Quest: Visual and Textual Feedback for Image-Text Misalignment
di: Gordon, Brian, et al.
Pubblicazione: (2023)
di: Gordon, Brian, et al.
Pubblicazione: (2023)
FLEURS-ASL: Including American Sign Language in Massively Multilingual Multitask Evaluation
di: Tanzer, Garrett
Pubblicazione: (2024)
di: Tanzer, Garrett
Pubblicazione: (2024)
Fingerspelling within Sign Language Translation
di: Tanzer, Garrett
Pubblicazione: (2024)
di: Tanzer, Garrett
Pubblicazione: (2024)
YouTube-SL-25: A Large-Scale, Open-Domain Multilingual Sign Language Parallel Corpus
di: Tanzer, Garrett, et al.
Pubblicazione: (2024)
di: Tanzer, Garrett, et al.
Pubblicazione: (2024)
ZARANA MEHTA (RIBA , Assoc.AIA , HKIA + ACU ARB) PART 1 , 2 & 3
di: Mehta, Zarana
Pubblicazione: (2025)
di: Mehta, Zarana
Pubblicazione: (2025)
Revisiting Text-to-Image Evaluation with Gecko: On Metrics, Prompts, and Human Ratings
di: Wiles, Olivia, et al.
Pubblicazione: (2024)
di: Wiles, Olivia, et al.
Pubblicazione: (2024)
Scaling Sign Language Translation
di: Zhang, Biao, et al.
Pubblicazione: (2024)
di: Zhang, Biao, et al.
Pubblicazione: (2024)
Investigating Concept Alignment Using Implausible Category Members
di: Rane, Sunayana, et al.
Pubblicazione: (2026)
di: Rane, Sunayana, et al.
Pubblicazione: (2026)
Contrastive Sequential-Diffusion Learning: Non-linear and Multi-Scene Instructional Video Synthesis
di: Ramos, Vasco, et al.
Pubblicazione: (2024)
di: Ramos, Vasco, et al.
Pubblicazione: (2024)
Modeling Real-Time Interactive Conversations as Timed Diarized Transcripts
di: Tanzer, Garrett, et al.
Pubblicazione: (2024)
di: Tanzer, Garrett, et al.
Pubblicazione: (2024)
EgoCast: Forecasting Egocentric Human Pose in the Wild
di: Escobar, Maria, et al.
Pubblicazione: (2024)
di: Escobar, Maria, et al.
Pubblicazione: (2024)
Reconsidering Sentence-Level Sign Language Translation
di: Tanzer, Garrett, et al.
Pubblicazione: (2024)
di: Tanzer, Garrett, et al.
Pubblicazione: (2024)
Evaluating Numerical Reasoning in Text-to-Image Models
di: Kajić, Ivana, et al.
Pubblicazione: (2024)
di: Kajić, Ivana, et al.
Pubblicazione: (2024)
Stanford oceanographic expedition 17, Galapagos Islands and vicinity, 22 February-23 March 1968: observations on birds, the Galapagos fur seal, and cetaceans
di: Baldridge, Alan
Pubblicazione: (1968)
di: Baldridge, Alan
Pubblicazione: (1968)
Convolutional Neural Networks Can (Meta-)Learn the Same-Different Relation
di: Gupta, Max, et al.
Pubblicazione: (2025)
di: Gupta, Max, et al.
Pubblicazione: (2025)
Energéticos y política mundial / Michael Tanzer ; traducción de Horacio Zalce
di: Tanzer, Michael
di: Tanzer, Michael
Process optimization for biodiesel production from neutralized waste cooking oil and the effect of this biodiesel on engine performance
di: Eryilmaz Tanzer
Pubblicazione: (2018)
di: Eryilmaz Tanzer
Pubblicazione: (2018)
ParallelPARC: A Scalable Pipeline for Generating Natural-Language Analogies
di: Sultan, Oren, et al.
Pubblicazione: (2024)
di: Sultan, Oren, et al.
Pubblicazione: (2024)
EditInspector: A Benchmark for Evaluation of Text-Guided Image Edits
di: Yosef, Ron, et al.
Pubblicazione: (2025)
di: Yosef, Ron, et al.
Pubblicazione: (2025)
Concept Alignment
di: Rane, Sunayana, et al.
Pubblicazione: (2024)
di: Rane, Sunayana, et al.
Pubblicazione: (2024)
Contrastive Region Guidance: Improving Grounding in Vision-Language Models without Training
di: Wan, David, et al.
Pubblicazione: (2024)
di: Wan, David, et al.
Pubblicazione: (2024)
Into the Unknown: Generating Geospatial Descriptions for New Environments
di: Paz-Argaman, Tzuf, et al.
Pubblicazione: (2024)
di: Paz-Argaman, Tzuf, et al.
Pubblicazione: (2024)
A Benchmark for Learning to Translate a New Language from One Grammar Book
di: Tanzer, Garrett, et al.
Pubblicazione: (2023)
di: Tanzer, Garrett, et al.
Pubblicazione: (2023)
Editor's Choice: Evaluating Abstract Intent in Image Editing through Atomic Entity Analysis
di: Ventura, Mor, et al.
Pubblicazione: (2026)
di: Ventura, Mor, et al.
Pubblicazione: (2026)
Detecting Stylistic Fingerprints of Large Language Models
di: Bitton, Yehonatan, et al.
Pubblicazione: (2025)
di: Bitton, Yehonatan, et al.
Pubblicazione: (2025)
La ciudad común en fiesta. Espacios para la construcción cultural
di: Juan J. Tuset
Pubblicazione: (2012)
di: Juan J. Tuset
Pubblicazione: (2012)
Santa Teresa de Jesús, su guion de vida
di: Carmen Thous Tuset
Pubblicazione: (2015)
di: Carmen Thous Tuset
Pubblicazione: (2015)
Heimatkunde in der DDR. Didaktische Ansätze und Spannungsfelder
di: Fischer, Christian, et al.
Pubblicazione: (2024)
di: Fischer, Christian, et al.
Pubblicazione: (2024)
Bridging the Visual Gap: Fine-Tuning Multimodal Models with Knowledge-Adapted Captions
di: Yanuka, Moran, et al.
Pubblicazione: (2024)
di: Yanuka, Moran, et al.
Pubblicazione: (2024)
Video-STaR: Self-Training Enables Video Instruction Tuning with Any Supervision
di: Zohar, Orr, et al.
Pubblicazione: (2024)
di: Zohar, Orr, et al.
Pubblicazione: (2024)
A Methodological Investigation into the Application of the MVP Support System in Ensemble Performance Practice by Wind Instrument Players
di: Yamaguchi, Yasumasa
Pubblicazione: (2025)
di: Yamaguchi, Yasumasa
Pubblicazione: (2025)
Visual Riddles: a Commonsense and World Knowledge Challenge for Large Vision and Language Models
di: Bitton-Guetta, Nitzan, et al.
Pubblicazione: (2024)
di: Bitton-Guetta, Nitzan, et al.
Pubblicazione: (2024)
A new way to prove configuration reducibility using gauge theory
di: Baldridge, Scott, et al.
Pubblicazione: (2024)
di: Baldridge, Scott, et al.
Pubblicazione: (2024)
Quantum state systems that count perfect matchings
di: Baldridge, Scott, et al.
Pubblicazione: (2024)
di: Baldridge, Scott, et al.
Pubblicazione: (2024)
Documenti analoghi
-
ImageInWords: Unlocking Hyper-Detailed Image Descriptions
di: Garg, Roopal, et al.
Pubblicazione: (2024) -
Davidsonian Scene Graph: Improving Reliability in Fine-grained Evaluation for Text-to-Image Generation
di: Cho, Jaemin, et al.
Pubblicazione: (2023) -
TECCI: Tricky Edits of Collected and Curated Images
di: Agrawal, Aishwarya, et al.
Pubblicazione: (2026) -
The Reasonable Person Standard for AI
di: Rane, Sunayana
Pubblicazione: (2024) -
Unblocking Fine-Grained Evaluation of Detailed Captions: An Explaining AutoRater and Critic-and-Revise Pipeline
di: Gordon, Brian, et al.
Pubblicazione: (2025)