An End-to-End Model for Photo-Sharing Multi-modal Dialogue Generation
Fuente:
arXiv
Guardado en:
| Autores principales: | Guo, Peiming, Liu, Sinuo, Zhang, Yanzhao, Long, Dingkun, Xie, Pengjun, Zhang, Meishan, Zhang, Min |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Chinese Sequence Labeling with Semi-Supervised Boundary-Aware Language Model Pre-training
por: Zhang, Longhui, et al.
Publicado: (2024)
por: Zhang, Longhui, et al.
Publicado: (2024)
Language Models are Universal Embedders
por: Zhang, Xin, et al.
Publicado: (2023)
por: Zhang, Xin, et al.
Publicado: (2023)
Improving General Text Embedding Model: Tackling Task Conflict and Data Imbalance through Model Merging
por: Li, Mingxin, et al.
Publicado: (2024)
por: Li, Mingxin, et al.
Publicado: (2024)
Supervised Fine-Tuning or Contrastive Learning? Towards Better Multimodal LLM Reranking
por: Dai, Ziqi, et al.
Publicado: (2025)
por: Dai, Ziqi, et al.
Publicado: (2025)
GME: Improving Universal Multimodal Retrieval by Multimodal LLMs
por: Zhang, Xin, et al.
Publicado: (2024)
por: Zhang, Xin, et al.
Publicado: (2024)
Contrastive Learning on LLM Back Generation Treebank for Cross-domain Constituency Parsing
por: Guo, Peiming, et al.
Publicado: (2025)
por: Guo, Peiming, et al.
Publicado: (2025)
Towards Text-Image Interleaved Retrieval
por: Zhang, Xin, et al.
Publicado: (2025)
por: Zhang, Xin, et al.
Publicado: (2025)
Towards Universal Video Retrieval: Generalizing Video Embedding via Synthesized Multimodal Pyramid Curriculum
por: Guo, Zhuoning, et al.
Publicado: (2025)
por: Guo, Zhuoning, et al.
Publicado: (2025)
mGTE: Generalized Long-Context Text Representation and Reranking Models for Multilingual Text Retrieval
por: Zhang, Xin, et al.
Publicado: (2024)
por: Zhang, Xin, et al.
Publicado: (2024)
A Two-Stage Adaptation of Large Language Models for Text Ranking
por: Zhang, Longhui, et al.
Publicado: (2023)
por: Zhang, Longhui, et al.
Publicado: (2023)
E2Rank: Your Text Embedding can Also be an Effective and Efficient Listwise Reranker
por: Liu, Qi, et al.
Publicado: (2025)
por: Liu, Qi, et al.
Publicado: (2025)
ERank: Fusing Supervised Fine-Tuning and Reinforcement Learning for Effective and Efficient Text Reranking
por: Cai, Yuzheng, et al.
Publicado: (2025)
por: Cai, Yuzheng, et al.
Publicado: (2025)
Dynamic Long Context Reasoning over Compressed Memory via End-to-End Reinforcement Learning
por: Chen, Zhuoen, et al.
Publicado: (2026)
por: Chen, Zhuoen, et al.
Publicado: (2026)
LaSER: Internalizing Explicit Reasoning into Latent Space for Dense Retrieval
por: Jin, Jiajie, et al.
Publicado: (2026)
por: Jin, Jiajie, et al.
Publicado: (2026)
Rethinking Composed Image Retrieval Evaluation: A Fine-Grained Benchmark from Image Editing
por: Song, Tingyu, et al.
Publicado: (2026)
por: Song, Tingyu, et al.
Publicado: (2026)
DiffuRank: Effective Document Reranking with Diffusion Language Models
por: Liu, Qi, et al.
Publicado: (2026)
por: Liu, Qi, et al.
Publicado: (2026)
Qwen3 Embedding: Advancing Text Embedding and Reranking Through Foundation Models
por: Zhang, Yanzhao, et al.
Publicado: (2025)
por: Zhang, Yanzhao, et al.
Publicado: (2025)
End-to-End Beam Retrieval for Multi-Hop Question Answering
por: Zhang, Jiahao, et al.
Publicado: (2023)
por: Zhang, Jiahao, et al.
Publicado: (2023)
Enhancing Speech-to-Speech Dialogue Modeling with End-to-End Retrieval-Augmented Generation
por: Feng, Pengchao, et al.
Publicado: (2025)
por: Feng, Pengchao, et al.
Publicado: (2025)
Bidirectional End-to-End Learning of Retriever-Reader Paradigm for Entity Linking
por: Li, Yinghui, et al.
Publicado: (2023)
por: Li, Yinghui, et al.
Publicado: (2023)
Text2Token: Unsupervised Text Representation Learning with Token Target Prediction
por: An, Ruize, et al.
Publicado: (2025)
por: An, Ruize, et al.
Publicado: (2025)
URO-Bench: Towards Comprehensive Evaluation for End-to-End Spoken Dialogue Models
por: Yan, Ruiqi, et al.
Publicado: (2025)
por: Yan, Ruiqi, et al.
Publicado: (2025)
Qwen3-VL-Embedding and Qwen3-VL-Reranker: A Unified Framework for State-of-the-Art Multimodal Retrieval and Ranking
por: Li, Mingxin, et al.
Publicado: (2026)
por: Li, Mingxin, et al.
Publicado: (2026)
E2E-AFG: An End-to-End Model with Adaptive Filtering for Retrieval-Augmented Generation
por: Jiang, Yun, et al.
Publicado: (2024)
por: Jiang, Yun, et al.
Publicado: (2024)
A Non-autoregressive Generation Framework for End-to-End Simultaneous Speech-to-Speech Translation
por: Ma, Zhengrui, et al.
Publicado: (2024)
por: Ma, Zhengrui, et al.
Publicado: (2024)
When Text Embedding Meets Large Language Model: A Comprehensive Survey
por: Nie, Zhijie, et al.
Publicado: (2024)
por: Nie, Zhijie, et al.
Publicado: (2024)
WavBench: Benchmarking Reasoning, Colloquialism, and Paralinguistics for End-to-End Spoken Dialogue Models
por: Li, Yangzhuo, et al.
Publicado: (2026)
por: Li, Yangzhuo, et al.
Publicado: (2026)
Cross-modality Data Augmentation for End-to-End Sign Language Translation
por: Ye, Jinhui, et al.
Publicado: (2023)
por: Ye, Jinhui, et al.
Publicado: (2023)
Unsupervised End-to-End Task-Oriented Dialogue with LLMs: The Power of the Noisy Channel
por: King, Brendan, et al.
Publicado: (2024)
por: King, Brendan, et al.
Publicado: (2024)
LEEETs-Dial: Linguistic Entrainment in End-to-End Task-oriented Dialogue systems
por: Kumar, Nalin, et al.
Publicado: (2023)
por: Kumar, Nalin, et al.
Publicado: (2023)
Translatotron-V(ison): An End-to-End Model for In-Image Machine Translation
por: Lan, Zhibin, et al.
Publicado: (2024)
por: Lan, Zhibin, et al.
Publicado: (2024)
On The Role of Pretrained Language Models in General-Purpose Text Embeddings: A Survey
por: Zhang, Meishan, et al.
Publicado: (2025)
por: Zhang, Meishan, et al.
Publicado: (2025)
HITSZ's End-To-End Speech Translation Systems Combining Sequence-to-Sequence Auto Speech Recognition Model and Indic Large Language Model for IWSLT 2025 in Indic Track
por: Wei, Xuchen, et al.
Publicado: (2025)
por: Wei, Xuchen, et al.
Publicado: (2025)
PrivMedChat: End-to-End Differentially Private RLHF for Medical Dialogue Systems
por: Bhujel, Sudip
Publicado: (2026)
por: Bhujel, Sudip
Publicado: (2026)
Leveraging Graph Structures and Large Language Models for End-to-End Synthetic Task-Oriented Dialogues
por: Medjad, Maya, et al.
Publicado: (2025)
por: Medjad, Maya, et al.
Publicado: (2025)
WildSpeech-Bench: Benchmarking End-to-End SpeechLLMs in the Wild
por: Zhang, Linhao, et al.
Publicado: (2025)
por: Zhang, Linhao, et al.
Publicado: (2025)
GSQA: An End-to-End Model for Generative Spoken Question Answering
por: Shih, Min-Han, et al.
Publicado: (2023)
por: Shih, Min-Han, et al.
Publicado: (2023)
Using Large Language Model for End-to-End Chinese ASR and NER
por: Li, Yuang, et al.
Publicado: (2024)
por: Li, Yuang, et al.
Publicado: (2024)
FlashLabs Chroma 1.0: A Real-Time End-to-End Spoken Dialogue Model with Personalized Voice Cloning
por: Chen, Tanyu, et al.
Publicado: (2026)
por: Chen, Tanyu, et al.
Publicado: (2026)
E2E-GMNER: End-to-End Generative Grounded Multimodal Named Entity Recognition
por: Zhang, Meng, et al.
Publicado: (2026)
por: Zhang, Meng, et al.
Publicado: (2026)
Ejemplares similares
-
Chinese Sequence Labeling with Semi-Supervised Boundary-Aware Language Model Pre-training
por: Zhang, Longhui, et al.
Publicado: (2024) -
Language Models are Universal Embedders
por: Zhang, Xin, et al.
Publicado: (2023) -
Improving General Text Embedding Model: Tackling Task Conflict and Data Imbalance through Model Merging
por: Li, Mingxin, et al.
Publicado: (2024) -
Supervised Fine-Tuning or Contrastive Learning? Towards Better Multimodal LLM Reranking
por: Dai, Ziqi, et al.
Publicado: (2025) -
GME: Improving Universal Multimodal Retrieval by Multimodal LLMs
por: Zhang, Xin, et al.
Publicado: (2024)