A Joint Study of Phrase Grounding and Task Performance in Vision and Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Kojima, Noriyuki, Averbuch-Elor, Hadar, Artzi, Yoav |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Kiki or Bouba? Sound Symbolism in Vision-and-Language Models
di: Alper, Morris, et al.
Pubblicazione: (2023)
di: Alper, Morris, et al.
Pubblicazione: (2023)
Emergent Visual-Semantic Hierarchies in Image-Text Representations
di: Alper, Morris, et al.
Pubblicazione: (2024)
di: Alper, Morris, et al.
Pubblicazione: (2024)
Raster2Seq: Polygon Sequence Generation for Floorplan Reconstruction
di: Phung, Hao, et al.
Pubblicazione: (2026)
di: Phung, Hao, et al.
Pubblicazione: (2026)
Dynamic Scene Understanding from Vision-Language Representations
di: Pruss, Shahaf, et al.
Pubblicazione: (2025)
di: Pruss, Shahaf, et al.
Pubblicazione: (2025)
Thinking in Blender: Staged Executable Inverse Graphics with Vision-Language Models
di: He, Guangzhao, et al.
Pubblicazione: (2026)
di: He, Guangzhao, et al.
Pubblicazione: (2026)
Supercharging Floorplan Localization with Semantic Rays
di: Grader, Yuval, et al.
Pubblicazione: (2025)
di: Grader, Yuval, et al.
Pubblicazione: (2025)
InstanceGen: Image Generation with Instance-level Instructions
di: Sella, Etai, et al.
Pubblicazione: (2025)
di: Sella, Etai, et al.
Pubblicazione: (2025)
Composing People Together: Iterative Pose-Image Generation for Multi-Person Interaction Scenes
di: Peng, Wenxuan, et al.
Pubblicazione: (2026)
di: Peng, Wenxuan, et al.
Pubblicazione: (2026)
Scene Grounding In the Wild
di: Cohen, Tamir, et al.
Pubblicazione: (2026)
di: Cohen, Tamir, et al.
Pubblicazione: (2026)
Let it Snow! Animating 3D Gaussian Scenes with Dynamic Weather Effects via Physics-Guided Score Distillation
di: Fiebelman, Gal, et al.
Pubblicazione: (2025)
di: Fiebelman, Gal, et al.
Pubblicazione: (2025)
Lang3D-XL: Language Embedded 3D Gaussians for Large-scale Scenes
di: Krakovsky, Shai, et al.
Pubblicazione: (2025)
di: Krakovsky, Shai, et al.
Pubblicazione: (2025)
Color Bind: Exploring Color Perception in Text-to-Image Models
di: Shomer-Chai, Shay, et al.
Pubblicazione: (2025)
di: Shomer-Chai, Shay, et al.
Pubblicazione: (2025)
WAFFLE: Multimodal Floorplan Understanding in the Wild
di: Ganon, Keren, et al.
Pubblicazione: (2024)
di: Ganon, Keren, et al.
Pubblicazione: (2024)
Extreme Rotation Estimation in the Wild
di: Bezalel, Hana, et al.
Pubblicazione: (2024)
di: Bezalel, Hana, et al.
Pubblicazione: (2024)
Emergent Extreme-View Geometry in 3D Foundation Models
di: Zhang, Yiwen, et al.
Pubblicazione: (2025)
di: Zhang, Yiwen, et al.
Pubblicazione: (2025)
Spice-E : Structural Priors in 3D Diffusion using Cross-Entity Attention
di: Sella, Etai, et al.
Pubblicazione: (2023)
di: Sella, Etai, et al.
Pubblicazione: (2023)
Blended Point Cloud Diffusion for Localized Text-guided Shape Editing
di: Sella, Etai, et al.
Pubblicazione: (2025)
di: Sella, Etai, et al.
Pubblicazione: (2025)
4-LEGS: 4D Language Embedded Gaussian Splatting
di: Fiebelman, Gal, et al.
Pubblicazione: (2024)
di: Fiebelman, Gal, et al.
Pubblicazione: (2024)
Talk Less, Interact Better: Evaluating In-context Conversational Adaptation in Multimodal LLMs
di: Hua, Yilun, et al.
Pubblicazione: (2024)
di: Hua, Yilun, et al.
Pubblicazione: (2024)
Generalised Medical Phrase Grounding
di: Zhang, Wenjun, et al.
Pubblicazione: (2025)
di: Zhang, Wenjun, et al.
Pubblicazione: (2025)
ICC: Quantifying Image Caption Concreteness for Multimodal Dataset Curation
di: Yanuka, Moran, et al.
Pubblicazione: (2024)
di: Yanuka, Moran, et al.
Pubblicazione: (2024)
WildCAT3D: Appearance-Aware Multi-View Diffusion in the Wild
di: Alper, Morris, et al.
Pubblicazione: (2025)
di: Alper, Morris, et al.
Pubblicazione: (2025)
Long-tail Internet photo reconstruction
di: Li, Yuan, et al.
Pubblicazione: (2026)
di: Li, Yuan, et al.
Pubblicazione: (2026)
CoGen: Learning from Feedback with Coupled Comprehension and Generation
di: Gul, Mustafa Omer, et al.
Pubblicazione: (2024)
di: Gul, Mustafa Omer, et al.
Pubblicazione: (2024)
MeshOn: Intersection-Free Mesh-to-Mesh Composition
di: Kim, Hyunwoo, et al.
Pubblicazione: (2026)
di: Kim, Hyunwoo, et al.
Pubblicazione: (2026)
Systole-Conditioned Generative Cardiac Motion
di: Zuler, Shahar, et al.
Pubblicazione: (2025)
di: Zuler, Shahar, et al.
Pubblicazione: (2025)
HaLo-NeRF: Learning Geometry-Guided Semantics for Exploring Unconstrained Photo Collections
di: Dudai, Chen, et al.
Pubblicazione: (2024)
di: Dudai, Chen, et al.
Pubblicazione: (2024)
Mitigating Open-Vocabulary Caption Hallucinations
di: Ben-Kish, Assaf, et al.
Pubblicazione: (2023)
di: Ben-Kish, Assaf, et al.
Pubblicazione: (2023)
Can We Predict Performance of Large Models across Vision-Language Tasks?
di: Zhao, Qinyu, et al.
Pubblicazione: (2024)
di: Zhao, Qinyu, et al.
Pubblicazione: (2024)
ProtoSnap: Prototype Alignment for Cuneiform Signs
di: Mikulinsky, Rachel, et al.
Pubblicazione: (2025)
di: Mikulinsky, Rachel, et al.
Pubblicazione: (2025)
ReNoise: Real Image Inversion Through Iterative Noising
di: Garibi, Daniel, et al.
Pubblicazione: (2024)
di: Garibi, Daniel, et al.
Pubblicazione: (2024)
Generate to Ground: Multimodal Text Conditioning Boosts Phrase Grounding in Medical Vision-Language Models
di: Nützel, Felix, et al.
Pubblicazione: (2025)
di: Nützel, Felix, et al.
Pubblicazione: (2025)
Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap
di: Xu, Yige, et al.
Pubblicazione: (2026)
di: Xu, Yige, et al.
Pubblicazione: (2026)
Evaluation and Enhancement of Semantic Grounding in Large Vision-Language Models
di: Lu, Jiaying, et al.
Pubblicazione: (2023)
di: Lu, Jiaying, et al.
Pubblicazione: (2023)
Enhancing Abnormality Grounding for Vision Language Models with Knowledge Descriptions
di: Li, Jun, et al.
Pubblicazione: (2025)
di: Li, Jun, et al.
Pubblicazione: (2025)
Show and Guide: Instructional-Plan Grounded Vision and Language Model
di: Glória-Silva, Diogo, et al.
Pubblicazione: (2024)
di: Glória-Silva, Diogo, et al.
Pubblicazione: (2024)
Musketeer: Joint Training for Multi-task Vision Language Model with Task Explanation Prompts
di: Zhang, Zhaoyang, et al.
Pubblicazione: (2023)
di: Zhang, Zhaoyang, et al.
Pubblicazione: (2023)
Vision-Language Modeling in PET/CT for Visual Grounding of Positive Findings
di: Huemann, Zachary, et al.
Pubblicazione: (2025)
di: Huemann, Zachary, et al.
Pubblicazione: (2025)
VividMed: Vision Language Model with Versatile Visual Grounding for Medicine
di: Luo, Lingxiao, et al.
Pubblicazione: (2024)
di: Luo, Lingxiao, et al.
Pubblicazione: (2024)
ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos
di: Hannan, Tanveer, et al.
Pubblicazione: (2024)
di: Hannan, Tanveer, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Kiki or Bouba? Sound Symbolism in Vision-and-Language Models
di: Alper, Morris, et al.
Pubblicazione: (2023) -
Emergent Visual-Semantic Hierarchies in Image-Text Representations
di: Alper, Morris, et al.
Pubblicazione: (2024) -
Raster2Seq: Polygon Sequence Generation for Floorplan Reconstruction
di: Phung, Hao, et al.
Pubblicazione: (2026) -
Dynamic Scene Understanding from Vision-Language Representations
di: Pruss, Shahaf, et al.
Pubblicazione: (2025) -
Thinking in Blender: Staged Executable Inverse Graphics with Vision-Language Models
di: He, Guangzhao, et al.
Pubblicazione: (2026)