Altogether: Image Captioning via Re-aligning Alt-text
Fuente:
arXiv
Saved in:
| Main Authors: | Xu, Hu, Huang, Po-Yao, Tan, Xiaoqing Ellen, Yeh, Ching-Feng, Kahn, Jacob, Jou, Christine, Ghosh, Gargi, Levy, Omer, Zettlemoyer, Luke, Yih, Wen-tau, Li, Shang-Wen, Xie, Saining, Feichtenhofer, Christoph |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Demystifying CLIP Data
by: Xu, Hu, et al.
Published: (2023)
by: Xu, Hu, et al.
Published: (2023)
Memory Layers at Scale
by: Berges, Vincent-Pierre, et al.
Published: (2024)
by: Berges, Vincent-Pierre, et al.
Published: (2024)
Improving Factuality with Explicit Working Memory
by: Chen, Mingda, et al.
Published: (2024)
by: Chen, Mingda, et al.
Published: (2024)
MoDE: CLIP Data Experts via Clustering
by: Ma, Jiawei, et al.
Published: (2024)
by: Ma, Jiawei, et al.
Published: (2024)
Anchored Decoding: Provably Reducing Copyright Risk for Any Language Model
by: He, Jacqueline, et al.
Published: (2026)
by: He, Jacqueline, et al.
Published: (2026)
Continual Learning via Sparse Memory Finetuning
by: Lin, Jessy, et al.
Published: (2025)
by: Lin, Jessy, et al.
Published: (2025)
Mixture-of-Transformers: A Sparse and Scalable Architecture for Multi-Modal Foundation Models
by: Liang, Weixin, et al.
Published: (2024)
by: Liang, Weixin, et al.
Published: (2024)
Reliable, Adaptable, and Attributable Language Models with Retrieval
by: Asai, Akari, et al.
Published: (2024)
by: Asai, Akari, et al.
Published: (2024)
Meta CLIP 2: A Worldwide Scaling Recipe
by: Chuang, Yung-Sung, et al.
Published: (2025)
by: Chuang, Yung-Sung, et al.
Published: (2025)
Few-Shot Data Synthesis for Open Domain Multi-Hop Question Answering
by: Chen, Mingda, et al.
Published: (2023)
by: Chen, Mingda, et al.
Published: (2023)
HoneyBee: Data Recipes for Vision-Language Reasoners
by: Bansal, Hritik, et al.
Published: (2025)
by: Bansal, Hritik, et al.
Published: (2025)
Learning to Reason for Factuality
by: Chen, Xilun, et al.
Published: (2025)
by: Chen, Xilun, et al.
Published: (2025)
Procedural Knowledge at Scale Improves Reasoning
by: Wu, Di, et al.
Published: (2026)
by: Wu, Di, et al.
Published: (2026)
Text Quality-Based Pruning for Efficient Training of Language Models
by: Sharma, Vasu, et al.
Published: (2024)
by: Sharma, Vasu, et al.
Published: (2024)
ImpRAG: Retrieval-Augmented Generation with Implicit Queries
by: Zhang, Wenzheng, et al.
Published: (2025)
by: Zhang, Wenzheng, et al.
Published: (2025)
Learning Facts at Scale with Active Reading
by: Lin, Jessy, et al.
Published: (2025)
by: Lin, Jessy, et al.
Published: (2025)
Group-Level Data Selection for Efficient Pretraining
by: Yu, Zichun, et al.
Published: (2025)
by: Yu, Zichun, et al.
Published: (2025)
Latrogenic Tympanic Membrane Perforation by Eustachian Tube Balloon Dilation Device
by: Peng Yeh, et al.
Published: (2025)
by: Peng Yeh, et al.
Published: (2025)
Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model
by: Zhou, Chunting, et al.
Published: (2024)
by: Zhou, Chunting, et al.
Published: (2024)
ReasonIR: Training Retrievers for Reasoning Tasks
by: Shao, Rulin, et al.
Published: (2025)
by: Shao, Rulin, et al.
Published: (2025)
The weighted Bergman spaces and complex reflection groups
by: Ghosh, Gargi
Published: (2021)
by: Ghosh, Gargi
Published: (2021)
DRAMA: Diverse Augmentation from Large Language Models to Smaller Dense Retrievers
by: Ma, Xueguang, et al.
Published: (2025)
by: Ma, Xueguang, et al.
Published: (2025)
Fast Byte Latent Transformer
by: Kallini, Julie, et al.
Published: (2026)
by: Kallini, Julie, et al.
Published: (2026)
MoMa: Efficient Early-Fusion Pre-training with Mixture of Modality-Aware Experts
by: Lin, Xi Victoria, et al.
Published: (2024)
by: Lin, Xi Victoria, et al.
Published: (2024)
Branch-Train-MiX: Mixing Expert LLMs into a Mixture-of-Experts LLM
by: Sukhbaatar, Sainbayar, et al.
Published: (2024)
by: Sukhbaatar, Sainbayar, et al.
Published: (2024)
Diagnosing and Treating Periodontitis and Multimorbidity Altogether: The Case Example of the Physical Exercise Hormone Irisin
by: Larysa Saboya Cavalotti Perdonsini, et al.
Published: (2026)
by: Larysa Saboya Cavalotti Perdonsini, et al.
Published: (2026)
Nearest Neighbor Speculative Decoding for LLM Generation and Attribution
by: Li, Minghan, et al.
Published: (2024)
by: Li, Minghan, et al.
Published: (2024)
FLAME: Factuality-Aware Alignment for Large Language Models
by: Lin, Sheng-Chieh, et al.
Published: (2024)
by: Lin, Sheng-Chieh, et al.
Published: (2024)
FACTORY: A Challenging Human-Verified Prompt Set for Long-Form Factuality
by: Chen, Mingda, et al.
Published: (2025)
by: Chen, Mingda, et al.
Published: (2025)
SelfCite: Self-Supervised Alignment for Context Attribution in Large Language Models
by: Chuang, Yung-Sung, et al.
Published: (2025)
by: Chuang, Yung-Sung, et al.
Published: (2025)
Compute Optimal Tokenization
by: Limisiewicz, Tomasz, et al.
Published: (2026)
by: Limisiewicz, Tomasz, et al.
Published: (2026)
Self-Alignment with Instruction Backtranslation
by: Li, Xian, et al.
Published: (2023)
by: Li, Xian, et al.
Published: (2023)
Inferring Alt-text For UI Icons With Large Language Models During App Development
by: Haque, Sabrina, et al.
Published: (2024)
by: Haque, Sabrina, et al.
Published: (2024)
MCM-DPO: Multifaceted Cross-Modal Direct Preference Optimization for Alt-text Generation
by: Fu, Jinlan, et al.
Published: (2025)
by: Fu, Jinlan, et al.
Published: (2025)
$2$-proper holomorphic images of classical Cartan domains
by: Ghosh, Gargi, et al.
Published: (2023)
by: Ghosh, Gargi, et al.
Published: (2023)
Holomorphic retracts in the Lie ball and the tetrablock
by: Ghosh, Gargi, et al.
Published: (2024)
by: Ghosh, Gargi, et al.
Published: (2024)
Eighty‐three facial landmarks for facial image alignment
by: Weng Yu‐Ching, et al.
Published: (2024)
by: Weng Yu‐Ching, et al.
Published: (2024)
Self-Pruned Key-Value Attention: Learning When to Write by Predicting Future Utility
by: Szilvasy, Gergely, et al.
Published: (2026)
by: Szilvasy, Gergely, et al.
Published: (2026)
AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark
by: Chai, Wenhao, et al.
Published: (2024)
by: Chai, Wenhao, et al.
Published: (2024)
Comparison of Phacoemulsification Alone and With Trabecular Microbypass Stent in Primary Open‐Angle Glaucoma and Normal‐Tension Glaucoma
by: Yu-Ting Tsao, et al.
Published: (2024)
by: Yu-Ting Tsao, et al.
Published: (2024)
Similar Items
-
Demystifying CLIP Data
by: Xu, Hu, et al.
Published: (2023) -
Memory Layers at Scale
by: Berges, Vincent-Pierre, et al.
Published: (2024) -
Improving Factuality with Explicit Working Memory
by: Chen, Mingda, et al.
Published: (2024) -
MoDE: CLIP Data Experts via Clustering
by: Ma, Jiawei, et al.
Published: (2024) -
Anchored Decoding: Provably Reducing Copyright Risk for Any Language Model
by: He, Jacqueline, et al.
Published: (2026)