FlexCap: Describe Anything in Images in Controllable Detail
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Dwibedi, Debidatta, Jain, Vidhi, Tompson, Jonathan, Zisserman, Andrew, Aytar, Yusuf |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
OVR: A Dataset for Open Vocabulary Temporal Repetition Counting in Videos
par: Dwibedi, Debidatta, et autres
Publié: (2024)
par: Dwibedi, Debidatta, et autres
Publié: (2024)
A Short Note on Evaluating RepNet for Temporal Repetition Counting in Videos
par: Dwibedi, Debidatta, et autres
Publié: (2024)
par: Dwibedi, Debidatta, et autres
Publié: (2024)
Describe Anything: Detailed Localized Image and Video Captioning
par: Lian, Long, et autres
Publié: (2025)
par: Lian, Long, et autres
Publié: (2025)
Describe Anything Anywhere At Any Moment
par: Gorlo, Nicolas, et autres
Publié: (2025)
par: Gorlo, Nicolas, et autres
Publié: (2025)
CapRL: Stimulating Dense Image Caption Capabilities via Reinforcement Learning
par: Xing, Long, et autres
Publié: (2025)
par: Xing, Long, et autres
Publié: (2025)
Describing Images $\textit{Fast and Slow}$: Quantifying and Predicting the Variation in Human Signals during Visuo-Linguistic Processes
par: Takmaz, Ece, et autres
Publié: (2024)
par: Takmaz, Ece, et autres
Publié: (2024)
Learning from One Continuous Video Stream
par: Carreira, João, et autres
Publié: (2023)
par: Carreira, João, et autres
Publié: (2023)
PoSh: Using Scene Graphs To Guide LLMs-as-a-Judge For Detailed Image Descriptions
par: Ananthram, Amith, et autres
Publié: (2025)
par: Ananthram, Amith, et autres
Publié: (2025)
ChartCap: Mitigating Hallucination of Dense Chart Captioning
par: Lim, Junyoung, et autres
Publié: (2025)
par: Lim, Junyoung, et autres
Publié: (2025)
CapsFusion: Rethinking Image-Text Data at Scale
par: Yu, Qiying, et autres
Publié: (2023)
par: Yu, Qiying, et autres
Publié: (2023)
CapGeo: A Caption-Assisted Approach to Geometric Reasoning
par: Li, Yuying, et autres
Publié: (2025)
par: Li, Yuying, et autres
Publié: (2025)
Open-World Object Counting in Videos
par: Amini-Naieni, Niki, et autres
Publié: (2025)
par: Amini-Naieni, Niki, et autres
Publié: (2025)
Catch Me If You Can Describe Me: Open-Vocabulary Camouflaged Instance Segmentation with Diffusion
par: Vu, Tuan-Anh, et autres
Publié: (2023)
par: Vu, Tuan-Anh, et autres
Publié: (2023)
ANAVI: Audio Noise Awareness using Visuals of Indoor environments for NAVIgation
par: Jain, Vidhi, et autres
Publié: (2024)
par: Jain, Vidhi, et autres
Publié: (2024)
LaMP-Cap: Personalized Figure Caption Generation With Multimodal Figure Profiles
par: Ng, Ho Yin 'Sam', et autres
Publié: (2025)
par: Ng, Ho Yin 'Sam', et autres
Publié: (2025)
CapArena: Benchmarking and Analyzing Detailed Image Captioning in the LLM Era
par: Cheng, Kanzhi, et autres
Publié: (2025)
par: Cheng, Kanzhi, et autres
Publié: (2025)
RadDiff: Describing Differences in Radiology Image Sets with Natural Language
par: Shen, Xiaoxian, et autres
Publié: (2026)
par: Shen, Xiaoxian, et autres
Publié: (2026)
New keypoint-based approach for recognising British Sign Language (BSL) from sequences
par: Deb, Oishi, et autres
Publié: (2024)
par: Deb, Oishi, et autres
Publié: (2024)
MLLMs Know Where to Look: Training-free Perception of Small Visual Details with Multimodal LLMs
par: Zhang, Jiarui, et autres
Publié: (2025)
par: Zhang, Jiarui, et autres
Publié: (2025)
CLEVRER-Humans: Describing Physical and Causal Events the Human Way
par: Mao, Jiayuan, et autres
Publié: (2023)
par: Mao, Jiayuan, et autres
Publié: (2023)
Do Large Multimodal Models Solve Caption Generation for Scientific Figures? Lessons Learned from SciCap Challenge 2023
par: Hsu, Ting-Yao E., et autres
Publié: (2025)
par: Hsu, Ting-Yao E., et autres
Publié: (2025)
Bayesian Optimization for Controlled Image Editing via LLMs
par: Cai, Chengkun, et autres
Publié: (2025)
par: Cai, Chengkun, et autres
Publié: (2025)
Enhancing Human-Computer Interaction in Chest X-ray Analysis using Vision and Language Model with Eye Gaze Patterns
par: Kim, Yunsoo, et autres
Publié: (2024)
par: Kim, Yunsoo, et autres
Publié: (2024)
Describe Anything in Medical Images
par: Xiao, Xi, et autres
Publié: (2025)
par: Xiao, Xi, et autres
Publié: (2025)
DescribeEarth: Describe Anything for Remote Sensing Images
par: Li, Kaiyu, et autres
Publié: (2025)
par: Li, Kaiyu, et autres
Publié: (2025)
Detail++: Training-Free Detail Enhancer for Text-to-Image Diffusion Models
par: Chen, Lifeng, et autres
Publié: (2025)
par: Chen, Lifeng, et autres
Publié: (2025)
LOTUS: A Leaderboard for Detailed Image Captioning from Quality to Societal Bias and User Preferences
par: Hirota, Yusuke, et autres
Publié: (2025)
par: Hirota, Yusuke, et autres
Publié: (2025)
Segment Anything in Pathology Images with Natural Language
par: Chen, Zhixuan, et autres
Publié: (2025)
par: Chen, Zhixuan, et autres
Publié: (2025)
FlexGen: Flexible Multi-View Generation from Text and Image Inputs
par: Xu, Xinli, et autres
Publié: (2024)
par: Xu, Xinli, et autres
Publié: (2024)
Exploring the Frontier of Vision-Language Models: A Survey of Current Methodologies and Future Directions
par: Ghosh, Akash, et autres
Publié: (2024)
par: Ghosh, Akash, et autres
Publié: (2024)
Outside Knowledge Conversational Video (OKCV) Dataset -- Dialoguing over Videos
par: Reichman, Benjamin, et autres
Publié: (2025)
par: Reichman, Benjamin, et autres
Publié: (2025)
All in an Aggregated Image for In-Image Learning
par: Wang, Lei, et autres
Publié: (2024)
par: Wang, Lei, et autres
Publié: (2024)
MGD-SAM2: Multi-view Guided Detail-enhanced Segment Anything Model 2 for High-Resolution Class-agnostic Segmentation
par: Shen, Haoran, et autres
Publié: (2025)
par: Shen, Haoran, et autres
Publié: (2025)
SAM 3D: 3Dfy Anything in Images
par: SAM 3D Team, et autres
Publié: (2025)
par: SAM 3D Team, et autres
Publié: (2025)
Five Years of SciCap: What We Learned and Future Directions for Scientific Figure Captioning
par: Huang, Ting-Hao 'Kenneth', et autres
Publié: (2025)
par: Huang, Ting-Hao 'Kenneth', et autres
Publié: (2025)
Fine-Grained Image-Text Alignment in Medical Imaging Enables Explainable Cyclic Image-Report Generation
par: Chen, Wenting, et autres
Publié: (2023)
par: Chen, Wenting, et autres
Publié: (2023)
Pushing the Frontier of Black-Box LVLM Attacks via Fine-Grained Detail Targeting
par: Zhao, Xiaohan, et autres
Publié: (2026)
par: Zhao, Xiaohan, et autres
Publié: (2026)
The Describe-Then-Generate Bottleneck: How VLM Descriptions Alter Image Generation Outcomes
par: Kodathala, Sai Varun, et autres
Publié: (2025)
par: Kodathala, Sai Varun, et autres
Publié: (2025)
Thinking with Generated Images
par: Chern, Ethan, et autres
Publié: (2025)
par: Chern, Ethan, et autres
Publié: (2025)
Text-guided Image Restoration and Semantic Enhancement for Text-to-Image Person Retrieval
par: Liu, Delong, et autres
Publié: (2023)
par: Liu, Delong, et autres
Publié: (2023)
Documents similaires
-
OVR: A Dataset for Open Vocabulary Temporal Repetition Counting in Videos
par: Dwibedi, Debidatta, et autres
Publié: (2024) -
A Short Note on Evaluating RepNet for Temporal Repetition Counting in Videos
par: Dwibedi, Debidatta, et autres
Publié: (2024) -
Describe Anything: Detailed Localized Image and Video Captioning
par: Lian, Long, et autres
Publié: (2025) -
Describe Anything Anywhere At Any Moment
par: Gorlo, Nicolas, et autres
Publié: (2025) -
CapRL: Stimulating Dense Image Caption Capabilities via Reinforcement Learning
par: Xing, Long, et autres
Publié: (2025)