What If We Recaption Billions of Web Images with LLaMA-3?
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Xianhang, Tu, Haoqin, Hui, Mude, Wang, Zeyu, Zhao, Bingchen, Xiao, Junfei, Ren, Sucheng, Mei, Jieru, Liu, Qing, Zheng, Huangjie, Zhou, Yuyin, Xie, Cihang |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Medical Vision Generalist: Unifying Medical Imaging Tasks in Context
par: Ren, Sucheng, et autres
Publié: (2024)
par: Ren, Sucheng, et autres
Publié: (2024)
LLaMA Pro: Progressive LLaMA with Block Expansion
par: Wu, Chengyue, et autres
Publié: (2024)
par: Wu, Chengyue, et autres
Publié: (2024)
AttnGCG: Enhancing Jailbreaking Attacks on LLMs with Attention Manipulation
par: Wang, Zijun, et autres
Publié: (2024)
par: Wang, Zijun, et autres
Publié: (2024)
3D-TransUNet for Brain Metastases Segmentation in the BraTS2023 Challenge
par: Yang, Siwei, et autres
Publié: (2024)
par: Yang, Siwei, et autres
Publié: (2024)
ECHO-LLaMA: Efficient Caching for High-Performance LLaMA Training
par: Dialameh, Maryam, et autres
Publié: (2025)
par: Dialameh, Maryam, et autres
Publié: (2025)
Autoregressive Pretraining with Mamba in Vision
par: Ren, Sucheng, et autres
Publié: (2024)
par: Ren, Sucheng, et autres
Publié: (2024)
$\texttt{Complex-Edit}$: CoT-Like Instruction Generation for Complexity-Controllable Image Editing Benchmark
par: Yang, Siwei, et autres
Publié: (2025)
par: Yang, Siwei, et autres
Publié: (2025)
LLaMA-Reg: Using LLaMA 2 for Unsupervised Medical Image Registration
par: Ma, Mingrui, et autres
Publié: (2024)
par: Ma, Mingrui, et autres
Publié: (2024)
LLaMA-MoE: Building Mixture-of-Experts from LLaMA with Continual Pre-training
par: Zhu, Tong, et autres
Publié: (2024)
par: Zhu, Tong, et autres
Publié: (2024)
A Preliminary Study of o1 in Medicine: Are We Closer to an AI Doctor?
par: Xie, Yunfei, et autres
Publié: (2024)
par: Xie, Yunfei, et autres
Publié: (2024)
OpenVision: A Fully-Open, Cost-Effective Family of Advanced Vision Encoders for Multimodal Learning
par: Li, Xianhang, et autres
Publié: (2025)
par: Li, Xianhang, et autres
Publié: (2025)
CLIPS: An Enhanced CLIP Framework for Learning with Synthetic Captions
par: Liu, Yanqing, et autres
Publié: (2024)
par: Liu, Yanqing, et autres
Publié: (2024)
Rejuvenating image-GPT as Strong Visual Representation Learners
par: Ren, Sucheng, et autres
Publié: (2023)
par: Ren, Sucheng, et autres
Publié: (2023)
LogLLaMA: Transformer-based log anomaly detection with LLaMA
par: Yang, Zhuoyi, et autres
Publié: (2025)
par: Yang, Zhuoyi, et autres
Publié: (2025)
VisionLLaMA: A Unified LLaMA Backbone for Vision Tasks
par: Chu, Xiangxiang, et autres
Publié: (2024)
par: Chu, Xiangxiang, et autres
Publié: (2024)
LLaMA-MoE v2: Exploring Sparsity of LLaMA from Perspective of Mixture-of-Experts with Post-Training
par: Qu, Xiaoye, et autres
Publié: (2024)
par: Qu, Xiaoye, et autres
Publié: (2024)
Mamba-R: Vision Mamba ALSO Needs Registers
par: Wang, Feng, et autres
Publié: (2024)
par: Wang, Feng, et autres
Publié: (2024)
Adapting LLaMA Decoder to Vision Transformer
par: Wang, Jiahao, et autres
Publié: (2024)
par: Wang, Jiahao, et autres
Publié: (2024)
BanglaLlama: LLaMA for Bangla Language
par: Zehady, Abdullah Khan, et autres
Publié: (2024)
par: Zehady, Abdullah Khan, et autres
Publié: (2024)
Amharic LLaMA and LLaVA: Multimodal LLMs for Low Resource Languages
par: Andersland, Michael
Publié: (2024)
par: Andersland, Michael
Publié: (2024)
HQ-Edit: A High-Quality Dataset for Instruction-based Image Editing
par: Hui, Mude, et autres
Publié: (2024)
par: Hui, Mude, et autres
Publié: (2024)
LLaMAs Have Feelings Too: Unveiling Sentiment and Emotion Representations in LLaMA Models Through Probing
par: Di Palma, Dario, et autres
Publié: (2025)
par: Di Palma, Dario, et autres
Publié: (2025)
Efficient and Effective Text Encoding for Chinese LLaMA and Alpaca
par: Cui, Yiming, et autres
Publié: (2023)
par: Cui, Yiming, et autres
Publié: (2023)
How Vocabulary Sharing Facilitates Multilingualism in LLaMA?
par: Yuan, Fei, et autres
Publié: (2023)
par: Yuan, Fei, et autres
Publié: (2023)
LLaMA-XR: A Novel Framework for Radiology Report Generation using LLaMA and QLoRA Fine Tuning
par: Jahangir, Md. Zihad Bin, et autres
Publié: (2025)
par: Jahangir, Md. Zihad Bin, et autres
Publié: (2025)
LLaMA-Based Models for Aspect-Based Sentiment Analysis
par: Šmíd, Jakub, et autres
Publié: (2025)
par: Šmíd, Jakub, et autres
Publié: (2025)
A Semantic Space is Worth 256 Language Descriptions: Make Stronger Segmentation Models with Descriptive Properties
par: Xiao, Junfei, et autres
Publié: (2023)
par: Xiao, Junfei, et autres
Publié: (2023)
Parameter-Efficient Fine-Tuning of LLaMA for the Clinical Domain
par: Gema, Aryo Pradipta, et autres
Publié: (2023)
par: Gema, Aryo Pradipta, et autres
Publié: (2023)
LLaMA based Punctuation Restoration With Forward Pass Only Decoding
par: Pang, Yutong, et autres
Publié: (2024)
par: Pang, Yutong, et autres
Publié: (2024)
Multimodal Medical Disease Classification with LLaMA II
par: Gapp, Christian, et autres
Publié: (2024)
par: Gapp, Christian, et autres
Publié: (2024)
OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning
par: Liu, Yanqing, et autres
Publié: (2025)
par: Liu, Yanqing, et autres
Publié: (2025)
LLaMA-E: Empowering E-commerce Authoring with Object-Interleaved Instruction Following
par: Shi, Kaize, et autres
Publié: (2023)
par: Shi, Kaize, et autres
Publié: (2023)
LLaMA-Excitor: General Instruction Tuning via Indirect Feature Interaction
par: Zou, Bo, et autres
Publié: (2024)
par: Zou, Bo, et autres
Publié: (2024)
LLaMA Beyond English: An Empirical Study on Language Capability Transfer
par: Zhao, Jun, et autres
Publié: (2024)
par: Zhao, Jun, et autres
Publié: (2024)
EMO-LLaMA: Enhancing Facial Emotion Understanding with Instruction Tuning
par: Xing, Bohao, et autres
Publié: (2024)
par: Xing, Bohao, et autres
Publié: (2024)
Me LLaMA: Foundation Large Language Models for Medical Applications
par: Xie, Qianqian, et autres
Publié: (2024)
par: Xie, Qianqian, et autres
Publié: (2024)
Revisiting Adversarial Training at Scale
par: Wang, Zeyu, et autres
Publié: (2024)
par: Wang, Zeyu, et autres
Publié: (2024)
Is Bigger and Deeper Always Better? Probing LLaMA Across Scales and Layers
par: Chen, Nuo, et autres
Publié: (2023)
par: Chen, Nuo, et autres
Publié: (2023)
SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models
par: Chen, Hardy, et autres
Publié: (2025)
par: Chen, Hardy, et autres
Publié: (2025)
Llamazip: Leveraging LLaMA for Lossless Text Compression and Training Dataset Detection
par: Dréano, Sören, et autres
Publié: (2025)
par: Dréano, Sören, et autres
Publié: (2025)
Documents similaires
-
Medical Vision Generalist: Unifying Medical Imaging Tasks in Context
par: Ren, Sucheng, et autres
Publié: (2024) -
LLaMA Pro: Progressive LLaMA with Block Expansion
par: Wu, Chengyue, et autres
Publié: (2024) -
AttnGCG: Enhancing Jailbreaking Attacks on LLMs with Attention Manipulation
par: Wang, Zijun, et autres
Publié: (2024) -
3D-TransUNet for Brain Metastases Segmentation in the BraTS2023 Challenge
par: Yang, Siwei, et autres
Publié: (2024) -
ECHO-LLaMA: Efficient Caching for High-Performance LLaMA Training
par: Dialameh, Maryam, et autres
Publié: (2025)