A Multimodal In-Context Tuning Approach for E-Commerce Product Description Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Yunxin, Hu, Baotian, Luo, Wenhan, Ma, Lin, Ding, Yuxin, Zhang, Min |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Uni-MoE: Scaling Unified Multimodal LLMs with Mixture of Experts
par: Li, Yunxin, et autres
Publié: (2024)
par: Li, Yunxin, et autres
Publié: (2024)
VideoVista-CulturalLingo: 360$^\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension
par: Chen, Xinyu, et autres
Publié: (2025)
par: Chen, Xinyu, et autres
Publié: (2025)
Vision Enhancing LLMs: Empowering Multimodal Knowledge Storage and Sharing in LLMs
par: Li, Yunxin, et autres
Publié: (2023)
par: Li, Yunxin, et autres
Publié: (2023)
Cognitive Visual-Language Mapper: Advancing Multimodal Comprehension with Enhanced Visual Knowledge Alignment
par: Li, Yunxin, et autres
Publié: (2024)
par: Li, Yunxin, et autres
Publié: (2024)
VisionGraph: Leveraging Large Multimodal Models for Graph Theory Problems in Visual Context
par: Li, Yunxin, et autres
Publié: (2024)
par: Li, Yunxin, et autres
Publié: (2024)
VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization
par: Li, Yunxin, et autres
Publié: (2025)
par: Li, Yunxin, et autres
Publié: (2025)
Anim-Director: A Large Multimodal Model Powered Agent for Controllable Animation Video Generation
par: Li, Yunxin, et autres
Publié: (2024)
par: Li, Yunxin, et autres
Publié: (2024)
VideoVista: A Versatile Benchmark for Video Understanding and Reasoning
par: Li, Yunxin, et autres
Publié: (2024)
par: Li, Yunxin, et autres
Publié: (2024)
Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models
par: Li, Yunxin, et autres
Publié: (2025)
par: Li, Yunxin, et autres
Publié: (2025)
LLMs Meet Long Video: Advancing Long Video Question Answering with An Interactive Visual Adapter in LLMs
par: Li, Yunxin, et autres
Publié: (2024)
par: Li, Yunxin, et autres
Publié: (2024)
Uni-MoE-2.0-Omni: Scaling Language-Centric Omnimodal Large Model with Advanced MoE, Training and Data
par: Li, Yunxin, et autres
Publié: (2025)
par: Li, Yunxin, et autres
Publié: (2025)
A Unified Agentic Framework for Evaluating Conditional Image Generation
par: Wang, Jifang, et autres
Publié: (2025)
par: Wang, Jifang, et autres
Publié: (2025)
ComfyUI-R1: Exploring Reasoning Models for Workflow Generation
par: Xu, Zhenran, et autres
Publié: (2025)
par: Xu, Zhenran, et autres
Publié: (2025)
ComfyUI-Copilot: An Intelligent Assistant for Automated Workflow Development
par: Xu, Zhenran, et autres
Publié: (2025)
par: Xu, Zhenran, et autres
Publié: (2025)
VimRAG: Navigating Massive Visual Context in Retrieval-Augmented Generation via Multimodal Memory Graph
par: Wang, Qiuchen, et autres
Publié: (2026)
par: Wang, Qiuchen, et autres
Publié: (2026)
AniMaker: Multi-Agent Animated Storytelling with MCTS-Driven Clip Generation
par: Shi, Haoyuan, et autres
Publié: (2025)
par: Shi, Haoyuan, et autres
Publié: (2025)
Kestrel: 3D Multimodal LLM for Part-Aware Grounded Description
par: Ahmed, Mahmoud, et autres
Publié: (2024)
par: Ahmed, Mahmoud, et autres
Publié: (2024)
Scaling Beyond Context: A Survey of Multimodal Retrieval-Augmented Generation for Document Understanding
par: Gao, Sensen, et autres
Publié: (2025)
par: Gao, Sensen, et autres
Publié: (2025)
SK-VQA: Synthetic Knowledge Generation at Scale for Training Context-Augmented Multimodal LLMs
par: Su, Xin, et autres
Publié: (2024)
par: Su, Xin, et autres
Publié: (2024)
Summarize the Past to Predict the Future: Natural Language Descriptions of Context Boost Multimodal Object Interaction Anticipation
par: Pasca, Razvan-George, et autres
Publié: (2023)
par: Pasca, Razvan-George, et autres
Publié: (2023)
E2E-GMNER: End-to-End Generative Grounded Multimodal Named Entity Recognition
par: Zhang, Meng, et autres
Publié: (2026)
par: Zhang, Meng, et autres
Publié: (2026)
Culture-Aware Humorous Captioning: Multimodal Humor Generation across Cultural Contexts
par: Xu, Run, et autres
Publié: (2026)
par: Xu, Run, et autres
Publié: (2026)
Co-Reinforcement Learning for Unified Multimodal Understanding and Generation
par: Jiang, Jingjing, et autres
Publié: (2025)
par: Jiang, Jingjing, et autres
Publié: (2025)
MENTOR: Efficient Multimodal-Conditioned Tuning for Autoregressive Vision Generation Models
par: Zhao, Haozhe, et autres
Publié: (2025)
par: Zhao, Haozhe, et autres
Publié: (2025)
A Multimodal, Multitask System for Generating E Commerce Text Listings from Images
par: Singh, Nayan Kumar
Publié: (2025)
par: Singh, Nayan Kumar
Publié: (2025)
Mono-InternVL: Pushing the Boundaries of Monolithic Multimodal Large Language Models with Endogenous Visual Pre-training
par: Luo, Gen, et autres
Publié: (2024)
par: Luo, Gen, et autres
Publié: (2024)
MSVBench: Towards Human-Level Evaluation of Multi-Shot Video Generation
par: Shi, Haoyuan, et autres
Publié: (2026)
par: Shi, Haoyuan, et autres
Publié: (2026)
Kosmos-G: Generating Images in Context with Multimodal Large Language Models
par: Pan, Xichen, et autres
Publié: (2023)
par: Pan, Xichen, et autres
Publié: (2023)
CODIS: Benchmarking Context-Dependent Visual Comprehension for Multimodal Large Language Models
par: Luo, Fuwen, et autres
Publié: (2024)
par: Luo, Fuwen, et autres
Publié: (2024)
Learning Domain Knowledge in Multimodal Large Language Models through Reinforcement Fine-Tuning
par: Cao, Qinglong, et autres
Publié: (2026)
par: Cao, Qinglong, et autres
Publié: (2026)
Otter: A Multi-Modal Model with In-Context Instruction Tuning
par: Li, Bo, et autres
Publié: (2023)
par: Li, Bo, et autres
Publié: (2023)
Parameter-Inverted Image Pyramid Networks for Visual Perception and Multimodal Understanding
par: Wang, Zhaokai, et autres
Publié: (2025)
par: Wang, Zhaokai, et autres
Publié: (2025)
Euclid: Supercharging Multimodal LLMs with Synthetic High-Fidelity Visual Descriptions
par: Zhang, Jiarui, et autres
Publié: (2024)
par: Zhang, Jiarui, et autres
Publié: (2024)
Probabilistic Concept Graph Reasoning for Multimodal Misinformation Detection
par: Yang, Ruichao, et autres
Publié: (2026)
par: Yang, Ruichao, et autres
Publié: (2026)
MFC-Bench: Benchmarking Multimodal Fact-Checking with Large Vision-Language Models
par: Wang, Shengkang, et autres
Publié: (2024)
par: Wang, Shengkang, et autres
Publié: (2024)
OmChat: A Recipe to Train Multimodal Language Models with Strong Long Context and Video Understanding
par: Zhao, Tiancheng, et autres
Publié: (2024)
par: Zhao, Tiancheng, et autres
Publié: (2024)
MathScape: Benchmarking Multimodal Large Language Models in Real-World Mathematical Contexts
par: Liang, Hao, et autres
Publié: (2024)
par: Liang, Hao, et autres
Publié: (2024)
Supervised Fine-Tuning or Contrastive Learning? Towards Better Multimodal LLM Reranking
par: Dai, Ziqi, et autres
Publié: (2025)
par: Dai, Ziqi, et autres
Publié: (2025)
ZALM3: Zero-Shot Enhancement of Vision-Language Alignment via In-Context Information in Multi-Turn Multimodal Medical Dialogue
par: Li, Zhangpu, et autres
Publié: (2024)
par: Li, Zhangpu, et autres
Publié: (2024)
Make LVLMs Focus: Context-Aware Attention Modulation for Better Multimodal In-Context Learning
par: Li, Yanshu, et autres
Publié: (2025)
par: Li, Yanshu, et autres
Publié: (2025)
Documents similaires
-
Uni-MoE: Scaling Unified Multimodal LLMs with Mixture of Experts
par: Li, Yunxin, et autres
Publié: (2024) -
VideoVista-CulturalLingo: 360$^\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension
par: Chen, Xinyu, et autres
Publié: (2025) -
Vision Enhancing LLMs: Empowering Multimodal Knowledge Storage and Sharing in LLMs
par: Li, Yunxin, et autres
Publié: (2023) -
Cognitive Visual-Language Mapper: Advancing Multimodal Comprehension with Enhanced Visual Knowledge Alignment
par: Li, Yunxin, et autres
Publié: (2024) -
VisionGraph: Leveraging Large Multimodal Models for Graph Theory Problems in Visual Context
par: Li, Yunxin, et autres
Publié: (2024)