KwaiChat: A Large-Scale Video-Driven Multilingual Mixed-Type Dialogue Corpus
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Shi, Xiaoming, Liu, Zeming, Lei, Yiming, Zhang, Chenkai, Leng, Haitao, Wang, Chuan, Liu, Qingjie, Che, Wanxiang, Liu, Shaoguo, Li, Size, Wang, Yunhong |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SeriesBench: A Benchmark for Narrative-Driven Drama Series Understanding
par: Zhang, Chenkai, et autres
Publié: (2025)
par: Zhang, Chenkai, et autres
Publié: (2025)
GODBench: A Benchmark for Multimodal Large Language Models in Video Comment Art
par: Lei, Yiming, et autres
Publié: (2025)
par: Lei, Yiming, et autres
Publié: (2025)
ContextQFormer: A New Context Modeling Method for Multi-Turn Multi-Modal Conversations
par: Lei, Yiming, et autres
Publié: (2025)
par: Lei, Yiming, et autres
Publié: (2025)
Mix-Ecom: Towards Mixed-Type E-Commerce Dialogues with Complex Domain Rules
par: Zhou, Chenyu, et autres
Publié: (2025)
par: Zhou, Chenyu, et autres
Publié: (2025)
STAMPsy: Towards SpatioTemporal-Aware Mixed-Type Dialogues for Psychological Counseling
par: Wang, Jieyi, et autres
Publié: (2024)
par: Wang, Jieyi, et autres
Publié: (2024)
Learn More, Forget Less: A Gradient-Aware Data Selection Approach for LLM
par: Liu, Yibai, et autres
Publié: (2025)
par: Liu, Yibai, et autres
Publié: (2025)
EntroCut: Entropy-Guided Adaptive Truncation for Efficient Chain-of-Thought Reasoning in Small-scale Large Reasoning Models
par: Yan, Hongxi, et autres
Publié: (2026)
par: Yan, Hongxi, et autres
Publié: (2026)
HIPTrack: Visual Tracking with Historical Prompts
par: Cai, Wenrui, et autres
Publié: (2023)
par: Cai, Wenrui, et autres
Publié: (2023)
CtxMIM: Context-Enhanced Masked Image Modeling for Remote Sensing Image Understanding
par: Zhang, Mingming, et autres
Publié: (2023)
par: Zhang, Mingming, et autres
Publié: (2023)
SPMTrack: Spatio-Temporal Parameter-Efficient Fine-Tuning with Mixture of Experts for Scalable Visual Tracking
par: Cai, Wenrui, et autres
Publié: (2025)
par: Cai, Wenrui, et autres
Publié: (2025)
HiT: Building Mapping with Hierarchical Transformers
par: Zhang, Mingming, et autres
Publié: (2023)
par: Zhang, Mingming, et autres
Publié: (2023)
A Survey on Remote Sensing Foundation Models: From Vision to Multimodality
par: Huang, Ziyue, et autres
Publié: (2025)
par: Huang, Ziyue, et autres
Publié: (2025)
A Survey on Data Synthesis and Augmentation for Large Language Models
par: Wang, Ke, et autres
Publié: (2024)
par: Wang, Ke, et autres
Publié: (2024)
Multilingual Multi-Aspect Explainability Analyses on Machine Reading Comprehension Models
par: Cui, Yiming, et autres
Publié: (2021)
par: Cui, Yiming, et autres
Publié: (2021)
2M-NER: Contrastive Learning for Multilingual and Multimodal NER with Language and Modal Fusion
par: Wang, Dongsheng, et autres
Publié: (2024)
par: Wang, Dongsheng, et autres
Publié: (2024)
Semantic Enhanced Few-shot Object Detection
par: Wang, Zheng, et autres
Publié: (2024)
par: Wang, Zheng, et autres
Publié: (2024)
Reasoning-Driven Anomaly Detection and Localization with Image-Level Supervision
par: Jin, Yizhou, et autres
Publié: (2026)
par: Jin, Yizhou, et autres
Publié: (2026)
SkeletonX: Data-Efficient Skeleton-based Action Recognition via Cross-sample Feature Aggregation
par: Zhang, Zongye, et autres
Publié: (2025)
par: Zhang, Zongye, et autres
Publié: (2025)
AttriPrompt: Dynamic Prompt Composition Learning for CLIP
par: Zhan, Qiqi, et autres
Publié: (2025)
par: Zhan, Qiqi, et autres
Publié: (2025)
Towards Robust and Controllable Text-to-Motion via Masked Autoregressive Diffusion
par: Zhang, Zongye, et autres
Publié: (2025)
par: Zhang, Zongye, et autres
Publié: (2025)
Incremental Object Detection with CLIP
par: Huang, Ziyue, et autres
Publié: (2023)
par: Huang, Ziyue, et autres
Publié: (2023)
Lightweight Spatial Embedding for Vision-based 3D Occupancy Prediction
par: Zhang, Jinqing, et autres
Publié: (2024)
par: Zhang, Jinqing, et autres
Publié: (2024)
MutDet: Mutually Optimizing Pre-training for Remote Sensing Object Detection
par: Huang, Ziyue, et autres
Publié: (2024)
par: Huang, Ziyue, et autres
Publié: (2024)
PACF: Prototype Augmented Compact Features for Improving Domain Adaptive Object Detection
par: Liu, Chenguang, et autres
Publié: (2025)
par: Liu, Chenguang, et autres
Publié: (2025)
Generic Knowledge Boosted Pre-training For Remote Sensing Images
par: Huang, Ziyue, et autres
Publié: (2024)
par: Huang, Ziyue, et autres
Publié: (2024)
Beyond Open Vocabulary: Multimodal Prompting for Object Detection in Remote Sensing Images
par: Yang, Shuai, et autres
Publié: (2026)
par: Yang, Shuai, et autres
Publié: (2026)
Kwai Keye-VL Technical Report
par: Kwai Keye Team, et autres
Publié: (2025)
par: Kwai Keye Team, et autres
Publié: (2025)
KVQ: Kwai Video Quality Assessment for Short-form Videos
par: Lu, Yiting, et autres
Publié: (2024)
par: Lu, Yiting, et autres
Publié: (2024)
OpenRSD: Towards Open-prompts for Object Detection in Remote Sensing Images
par: Huang, Ziyue, et autres
Publié: (2025)
par: Huang, Ziyue, et autres
Publié: (2025)
YOLC: You Only Look Clusters for Tiny Object Detection in Aerial Images
par: Liu, Chenguang, et autres
Publié: (2024)
par: Liu, Chenguang, et autres
Publié: (2024)
De-Simplifying Pseudo Labels to Enhancing Domain Adaptive Object Detection
par: Fu, Zehua, et autres
Publié: (2025)
par: Fu, Zehua, et autres
Publié: (2025)
Deepfake Detection via Knowledge Injection
par: Li, Tonghui, et autres
Publié: (2025)
par: Li, Tonghui, et autres
Publié: (2025)
MULTITAT: Benchmarking Multilingual Table-and-Text Question Answering
par: Zhang, Xuanliang, et autres
Publié: (2025)
par: Zhang, Xuanliang, et autres
Publié: (2025)
ChatVTG: Video Temporal Grounding via Chat with Video Dialogue Large Language Models
par: Qu, Mengxue, et autres
Publié: (2024)
par: Qu, Mengxue, et autres
Publié: (2024)
LIBERO-X: Robustness Litmus for Vision-Language-Action Models
par: Wang, Guodong, et autres
Publié: (2026)
par: Wang, Guodong, et autres
Publié: (2026)
Kwai Summary Attention Technical Report
par: Chu, Chenglong, et autres
Publié: (2026)
par: Chu, Chenglong, et autres
Publié: (2026)
Context-Enhanced Detector For Building Detection From Remote Sensing Images
par: Huang, Ziyue, et autres
Publié: (2023)
par: Huang, Ziyue, et autres
Publié: (2023)
Medical Dialogue: A Survey of Categories, Methods, Evaluation and Challenges
par: Shi, Xiaoming, et autres
Publié: (2024)
par: Shi, Xiaoming, et autres
Publié: (2024)
Hierarchical Indexing with Knowledge Enrichment for Multilingual Video Corpus Retrieval
par: Wang, Yu, et autres
Publié: (2025)
par: Wang, Yu, et autres
Publié: (2025)
GMTalker: Gaussian Mixture-based Audio-Driven Emotional Talking Video Portraits
par: Xia, Yibo, et autres
Publié: (2023)
par: Xia, Yibo, et autres
Publié: (2023)
Documents similaires
-
SeriesBench: A Benchmark for Narrative-Driven Drama Series Understanding
par: Zhang, Chenkai, et autres
Publié: (2025) -
GODBench: A Benchmark for Multimodal Large Language Models in Video Comment Art
par: Lei, Yiming, et autres
Publié: (2025) -
ContextQFormer: A New Context Modeling Method for Multi-Turn Multi-Modal Conversations
par: Lei, Yiming, et autres
Publié: (2025) -
Mix-Ecom: Towards Mixed-Type E-Commerce Dialogues with Complex Domain Rules
par: Zhou, Chenyu, et autres
Publié: (2025) -
STAMPsy: Towards SpatioTemporal-Aware Mixed-Type Dialogues for Psychological Counseling
par: Wang, Jieyi, et autres
Publié: (2024)