VideoVista-CulturalLingo: 360$^\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Chen, Xinyu, Li, Yunxin, Shi, Haoyuan, Hu, Baotian, Luo, Wenhan, Wang, Yaowei, Zhang, Min |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
VideoVista: A Versatile Benchmark for Video Understanding and Reasoning
von: Li, Yunxin, et al.
Veröffentlicht: (2024)
von: Li, Yunxin, et al.
Veröffentlicht: (2024)
Cognitive Visual-Language Mapper: Advancing Multimodal Comprehension with Enhanced Visual Knowledge Alignment
von: Li, Yunxin, et al.
Veröffentlicht: (2024)
von: Li, Yunxin, et al.
Veröffentlicht: (2024)
Picking the Cream of the Crop: Visual-Centric Data Selection with Collaborative Agents
von: Liu, Zhenyu, et al.
Veröffentlicht: (2025)
von: Liu, Zhenyu, et al.
Veröffentlicht: (2025)
VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization
von: Li, Yunxin, et al.
Veröffentlicht: (2025)
von: Li, Yunxin, et al.
Veröffentlicht: (2025)
Anim-Director: A Large Multimodal Model Powered Agent for Controllable Animation Video Generation
von: Li, Yunxin, et al.
Veröffentlicht: (2024)
von: Li, Yunxin, et al.
Veröffentlicht: (2024)
A Multimodal In-Context Tuning Approach for E-Commerce Product Description Generation
von: Li, Yunxin, et al.
Veröffentlicht: (2024)
von: Li, Yunxin, et al.
Veröffentlicht: (2024)
VisionGraph: Leveraging Large Multimodal Models for Graph Theory Problems in Visual Context
von: Li, Yunxin, et al.
Veröffentlicht: (2024)
von: Li, Yunxin, et al.
Veröffentlicht: (2024)
LLMs Meet Long Video: Advancing Long Video Question Answering with An Interactive Visual Adapter in LLMs
von: Li, Yunxin, et al.
Veröffentlicht: (2024)
von: Li, Yunxin, et al.
Veröffentlicht: (2024)
A Comprehensive Evaluation of GPT-4V on Knowledge-Intensive Visual Question Answering
von: Li, Yunxin, et al.
Veröffentlicht: (2023)
von: Li, Yunxin, et al.
Veröffentlicht: (2023)
MSVBench: Towards Human-Level Evaluation of Multi-Shot Video Generation
von: Shi, Haoyuan, et al.
Veröffentlicht: (2026)
von: Shi, Haoyuan, et al.
Veröffentlicht: (2026)
Uni-MoE: Scaling Unified Multimodal LLMs with Mixture of Experts
von: Li, Yunxin, et al.
Veröffentlicht: (2024)
von: Li, Yunxin, et al.
Veröffentlicht: (2024)
Uni-MoE-2.0-Omni: Scaling Language-Centric Omnimodal Large Model with Advanced MoE, Training and Data
von: Li, Yunxin, et al.
Veröffentlicht: (2025)
von: Li, Yunxin, et al.
Veröffentlicht: (2025)
AniMaker: Multi-Agent Animated Storytelling with MCTS-Driven Clip Generation
von: Shi, Haoyuan, et al.
Veröffentlicht: (2025)
von: Shi, Haoyuan, et al.
Veröffentlicht: (2025)
VideoNorms: Benchmarking Cultural Awareness of Video Language Models
von: Varimalla, Nikhil Reddy, et al.
Veröffentlicht: (2025)
von: Varimalla, Nikhil Reddy, et al.
Veröffentlicht: (2025)
Bridging Cultural Nuances in Dialogue Agents through Cultural Value Surveys
von: Cao, Yong, et al.
Veröffentlicht: (2024)
von: Cao, Yong, et al.
Veröffentlicht: (2024)
WindowsWorld: A Process-Centric Benchmark of Autonomous GUI Agents in Professional Cross-Application Environments
von: Li, Jinchao, et al.
Veröffentlicht: (2026)
von: Li, Jinchao, et al.
Veröffentlicht: (2026)
Generative Multimodal Entity Linking
von: Shi, Senbao, et al.
Veröffentlicht: (2023)
von: Shi, Senbao, et al.
Veröffentlicht: (2023)
SambaLingo: Teaching Large Language Models New Languages
von: Csaki, Zoltan, et al.
Veröffentlicht: (2024)
von: Csaki, Zoltan, et al.
Veröffentlicht: (2024)
Vision Enhancing LLMs: Empowering Multimodal Knowledge Storage and Sharing in LLMs
von: Li, Yunxin, et al.
Veröffentlicht: (2023)
von: Li, Yunxin, et al.
Veröffentlicht: (2023)
Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models
von: Li, Yunxin, et al.
Veröffentlicht: (2025)
von: Li, Yunxin, et al.
Veröffentlicht: (2025)
UniMoE-Audio: Unified Speech and Music Generation with Dynamic-Capacity MoE
von: Liu, Zhenyu, et al.
Veröffentlicht: (2025)
von: Liu, Zhenyu, et al.
Veröffentlicht: (2025)
A Culturally-diverse Multilingual Multimodal Video Benchmark & Model
von: Shafique, Bhuiyan Sanjid, et al.
Veröffentlicht: (2025)
von: Shafique, Bhuiyan Sanjid, et al.
Veröffentlicht: (2025)
VideoSeek: Long-Horizon Video Agent with Tool-Guided Seeking
von: Lin, Jingyang, et al.
Veröffentlicht: (2026)
von: Lin, Jingyang, et al.
Veröffentlicht: (2026)
CMT: A Memory Compression Method for Continual Knowledge Learning of Large Language Models
von: Li, Dongfang, et al.
Veröffentlicht: (2024)
von: Li, Dongfang, et al.
Veröffentlicht: (2024)
A Unified Agentic Framework for Evaluating Conditional Image Generation
von: Wang, Jifang, et al.
Veröffentlicht: (2025)
von: Wang, Jifang, et al.
Veröffentlicht: (2025)
ToolOmni: Enabling Open-World Tool Use via Agentic learning with Proactive Retrieval and Grounded Execution
von: Huang, Shouzheng, et al.
Veröffentlicht: (2026)
von: Huang, Shouzheng, et al.
Veröffentlicht: (2026)
MELLA: Bridging Linguistic Capability and Cultural Groundedness for Low-Resource Language MLLMs
von: Gao, Yufei, et al.
Veröffentlicht: (2025)
von: Gao, Yufei, et al.
Veröffentlicht: (2025)
From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents
von: Lian, Niu, et al.
Veröffentlicht: (2026)
von: Lian, Niu, et al.
Veröffentlicht: (2026)
Bridging the Culture Gap: A Framework for LLM-Driven Socio-Cultural Localization of Math Word Problems in Low-Resource Languages
von: Azime, Israel Abebe, et al.
Veröffentlicht: (2025)
von: Azime, Israel Abebe, et al.
Veröffentlicht: (2025)
On The Role of Pretrained Language Models in General-Purpose Text Embeddings: A Survey
von: Zhang, Meishan, et al.
Veröffentlicht: (2025)
von: Zhang, Meishan, et al.
Veröffentlicht: (2025)
CDT: A Comprehensive Capability Framework for Large Language Models Across Cognition, Domain, and Task
von: Mo, Haosi, et al.
Veröffentlicht: (2025)
von: Mo, Haosi, et al.
Veröffentlicht: (2025)
360$^\circ$REA: Towards A Reusable Experience Accumulation with 360° Assessment for Multi-Agent System
von: Gao, Shen, et al.
Veröffentlicht: (2024)
von: Gao, Shen, et al.
Veröffentlicht: (2024)
SANSKRITI: A Comprehensive Benchmark for Evaluating Language Models' Knowledge of Indian Culture
von: Maji, Arijit, et al.
Veröffentlicht: (2025)
von: Maji, Arijit, et al.
Veröffentlicht: (2025)
Cultural Learning-Based Culture Adaptation of Language Models
von: Liu, Chen Cecilia, et al.
Veröffentlicht: (2025)
von: Liu, Chen Cecilia, et al.
Veröffentlicht: (2025)
Bridging the Multilingual Safety Divide: Efficient, Culturally-Aware Alignment for Global South Languages
von: Banerjee, Somnath, et al.
Veröffentlicht: (2026)
von: Banerjee, Somnath, et al.
Veröffentlicht: (2026)
Benchmarking Multimodal Models for Ukrainian Language Understanding Across Academic and Cultural Domains
von: Paniv, Yurii, et al.
Veröffentlicht: (2024)
von: Paniv, Yurii, et al.
Veröffentlicht: (2024)
HKCanto-Eval: A Benchmark for Evaluating Cantonese Language Understanding and Cultural Comprehension in LLMs
von: Cheng, Tsz Chung, et al.
Veröffentlicht: (2025)
von: Cheng, Tsz Chung, et al.
Veröffentlicht: (2025)
Dr3: Ask Large Language Models Not to Give Off-Topic Answers in Open Domain Multi-Hop Question Answering
von: Gao, Yuan, et al.
Veröffentlicht: (2024)
von: Gao, Yuan, et al.
Veröffentlicht: (2024)
CultureSynth: A Hierarchical Taxonomy-Guided and Retrieval-Augmented Framework for Cultural Question-Answer Synthesis
von: Zhang, Xinyu, et al.
Veröffentlicht: (2025)
von: Zhang, Xinyu, et al.
Veröffentlicht: (2025)
MusiLingo: Bridging Music and Text with Pre-trained Language Models for Music Captioning and Query Response
von: Deng, Zihao, et al.
Veröffentlicht: (2023)
von: Deng, Zihao, et al.
Veröffentlicht: (2023)
Ähnliche Einträge
-
VideoVista: A Versatile Benchmark for Video Understanding and Reasoning
von: Li, Yunxin, et al.
Veröffentlicht: (2024) -
Cognitive Visual-Language Mapper: Advancing Multimodal Comprehension with Enhanced Visual Knowledge Alignment
von: Li, Yunxin, et al.
Veröffentlicht: (2024) -
Picking the Cream of the Crop: Visual-Centric Data Selection with Collaborative Agents
von: Liu, Zhenyu, et al.
Veröffentlicht: (2025) -
VerIPO: Cultivating Long Reasoning in Video-LLMs via Verifier-Gudied Iterative Policy Optimization
von: Li, Yunxin, et al.
Veröffentlicht: (2025) -
Anim-Director: A Large Multimodal Model Powered Agent for Controllable Animation Video Generation
von: Li, Yunxin, et al.
Veröffentlicht: (2024)