Gespeichert in:
| Hauptverfasser: | Yang, Baoyao, Chen, Junxiang, Li, Wanyun, Yao, Wenbin, Zhou, Yang |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | https://arxiv.org/abs/2502.02885 |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
VideoMind: An Omni-Modal Video Dataset with Intent Grounding for Deep-Cognitive Video Understanding
von: Yang, Baoyao, et al.
Veröffentlicht: (2025)
von: Yang, Baoyao, et al.
Veröffentlicht: (2025)
Leveraging OpenFlamingo for Multimodal Embedding Analysis of C2C Car Parts Data
von: Rashid, Maisha Binte, et al.
Veröffentlicht: (2025)
von: Rashid, Maisha Binte, et al.
Veröffentlicht: (2025)
Evaluating Perspectival Biases in Cross-Modal Retrieval
von: Saengsukhiran, Teerapol, et al.
Veröffentlicht: (2025)
von: Saengsukhiran, Teerapol, et al.
Veröffentlicht: (2025)
A Grounded Memory System For Smart Personal Assistants
von: Ocker, Felix, et al.
Veröffentlicht: (2025)
von: Ocker, Felix, et al.
Veröffentlicht: (2025)
TriAlignGR: Triangular Multitask Alignment with Multimodal Deep Interest Mining for Generative Recommendation
von: Zeng, Yangchen, et al.
Veröffentlicht: (2026)
von: Zeng, Yangchen, et al.
Veröffentlicht: (2026)
Large Language Model for Qualitative Research -- A Systematic Mapping Study
von: Barros, Cauã Ferreira, et al.
Veröffentlicht: (2024)
von: Barros, Cauã Ferreira, et al.
Veröffentlicht: (2024)
Semantic Reconstruction of Adversarial Plagiarism: A Context-Aware Framework for Detecting and Restoring "Tortured Phrases" in Scientific Literature
von: Maiti, Agniva, et al.
Veröffentlicht: (2025)
von: Maiti, Agniva, et al.
Veröffentlicht: (2025)
DEUCE: Dual-diversity Enhancement and Uncertainty-awareness for Cold-start Active Learning
von: Guo, Jiaxin, et al.
Veröffentlicht: (2025)
von: Guo, Jiaxin, et al.
Veröffentlicht: (2025)
An Ensemble Embedding Approach for Improving Semantic Caching Performance in LLM-based Systems
von: Ghaffari, Shervin, et al.
Veröffentlicht: (2025)
von: Ghaffari, Shervin, et al.
Veröffentlicht: (2025)
ARTAI: An Evaluation Platform to Assess Societal Risk of Recommender Algorithms
von: Ruan, Qin, et al.
Veröffentlicht: (2024)
von: Ruan, Qin, et al.
Veröffentlicht: (2024)
AI vs. Human Moderators: A Comparative Evaluation of Multimodal LLMs in Content Moderation for Brand Safety
von: Levi, Adi, et al.
Veröffentlicht: (2025)
von: Levi, Adi, et al.
Veröffentlicht: (2025)
Tensor Manifold-Based Graph-Vector Fusion for AI-Native Academic Literature Retrieval
von: Wei, Xing, et al.
Veröffentlicht: (2026)
von: Wei, Xing, et al.
Veröffentlicht: (2026)
Visualizing the Evolution of Twitter (X.com) Conversations: A Comprehensive Methodology Applied to AI Training Discussions on ChatGPT
von: Jess, Nicole, et al.
Veröffentlicht: (2024)
von: Jess, Nicole, et al.
Veröffentlicht: (2024)
Exploring Diagnostic Prompting Approach for Multimodal LLM-based Visual Complexity Assessment: A Case Study of Amazon Search Result Pages
von: Murtadak, Divendar, et al.
Veröffentlicht: (2025)
von: Murtadak, Divendar, et al.
Veröffentlicht: (2025)
QoSGMAA: A Robust Multi-Order Graph Attention and Adversarial Framework for Sparse QoS Prediction
von: Du, Guanchen, et al.
Veröffentlicht: (2025)
von: Du, Guanchen, et al.
Veröffentlicht: (2025)
Spatially-Grounded Document Retrieval via Patch-to-Region Relevance Propagation
von: Georgiou, Athos
Veröffentlicht: (2025)
von: Georgiou, Athos
Veröffentlicht: (2025)
Predicting When to Trust Vision-Language Models for Spatial Reasoning
von: Imran, Muhammad, et al.
Veröffentlicht: (2026)
von: Imran, Muhammad, et al.
Veröffentlicht: (2026)
ReCoVR: Closing the Loop in Interactive Composed Video Retrieval
von: Zhang, Bingqing, et al.
Veröffentlicht: (2026)
von: Zhang, Bingqing, et al.
Veröffentlicht: (2026)
FinBERT-QA: Financial Question Answering with pre-trained BERT Language Models
von: Yuan, Bithiah
Veröffentlicht: (2025)
von: Yuan, Bithiah
Veröffentlicht: (2025)
MoXaRt: Audio-Visual Object-Guided Sound Interaction for XR
von: Xu, Tianyu, et al.
Veröffentlicht: (2026)
von: Xu, Tianyu, et al.
Veröffentlicht: (2026)
LinkedOut: Linking World Knowledge Representation Out of Video LLM for Next-Generation Video Recommendation
von: Zhang, Haichao, et al.
Veröffentlicht: (2025)
von: Zhang, Haichao, et al.
Veröffentlicht: (2025)
AVATAAR: Agentic Video Answering via Temporal Adaptive Alignment and Reasoning
von: Patel, Urjitkumar, et al.
Veröffentlicht: (2025)
von: Patel, Urjitkumar, et al.
Veröffentlicht: (2025)
From Citation Selection to Citation Absorption: A Measurement Framework for Generative Engine Optimization Across AI Search Platforms
von: Kai, Zhang, et al.
Veröffentlicht: (2026)
von: Kai, Zhang, et al.
Veröffentlicht: (2026)
Dense Video Understanding with Gated Residual Tokenization
von: Zhang, Haichao, et al.
Veröffentlicht: (2025)
von: Zhang, Haichao, et al.
Veröffentlicht: (2025)
DALL-M: Context-Aware Clinical Data Augmentation with LLMs
von: Hsieh, Chihcheng, et al.
Veröffentlicht: (2024)
von: Hsieh, Chihcheng, et al.
Veröffentlicht: (2024)
Bottleneck-based Encoder-decoder ARchitecture (BEAR) for Learning Unbiased Consumer-to-Consumer Image Representations
von: Rivas, Pablo, et al.
Veröffentlicht: (2024)
von: Rivas, Pablo, et al.
Veröffentlicht: (2024)
Higher education assessment practice in the era of generative AI tools
von: Ogunleye, Bayode, et al.
Veröffentlicht: (2024)
von: Ogunleye, Bayode, et al.
Veröffentlicht: (2024)
Enhancing XR Auditory Realism via Multimodal Scene-Aware Acoustic Rendering
von: Xu, Tianyu, et al.
Veröffentlicht: (2025)
von: Xu, Tianyu, et al.
Veröffentlicht: (2025)
VOGUE: A Multimodal Dataset for Conversational Recommendation in Fashion
von: Guo, David, et al.
Veröffentlicht: (2025)
von: Guo, David, et al.
Veröffentlicht: (2025)
Correspondence of high-dimensional emotion structures elicited by video clips between humans and Multimodal LLMs
von: Asanuma, Haruka, et al.
Veröffentlicht: (2025)
von: Asanuma, Haruka, et al.
Veröffentlicht: (2025)
Experimentation Accelerator: Interpretable Insights and Creative Recommendations for A/B Testing with Content-Aware ranking
von: Hu, Zhengmian, et al.
Veröffentlicht: (2026)
von: Hu, Zhengmian, et al.
Veröffentlicht: (2026)
CourseTimeQA: A Lecture-Video Benchmark and a Latency-Constrained Cross-Modal Fusion Method for Timestamped QA
von: Kovalev, Vsevolod, et al.
Veröffentlicht: (2025)
von: Kovalev, Vsevolod, et al.
Veröffentlicht: (2025)
Real-World En Call Center Transcripts Dataset with PII Redaction
von: Dao, Ha, et al.
Veröffentlicht: (2025)
von: Dao, Ha, et al.
Veröffentlicht: (2025)
ORPHEAS: A Cross-Lingual Greek-English Embedding Model for Retrieval-Augmented Generation
von: Livieris, Ioannis E., et al.
Veröffentlicht: (2026)
von: Livieris, Ioannis E., et al.
Veröffentlicht: (2026)
HySemRAG: A Hybrid Semantic Retrieval-Augmented Generation Framework for Automated Literature Synthesis and Methodological Gap Analysis
von: Godinez, Alejandro
Veröffentlicht: (2025)
von: Godinez, Alejandro
Veröffentlicht: (2025)
Incorporating Legal Structure in Retrieval-Augmented Generation: A Case Study on Copyright Fair Use
von: Ho, Justin, et al.
Veröffentlicht: (2025)
von: Ho, Justin, et al.
Veröffentlicht: (2025)
To Retrieve or Not to Retrieve? Uncertainty Detection for Dynamic Retrieval Augmented Generation
von: Dhole, Kaustubh D.
Veröffentlicht: (2025)
von: Dhole, Kaustubh D.
Veröffentlicht: (2025)
LLMLogAnalyzer: A Clustering-Based Log Analysis Chatbot using Large Language Models
von: Cai, Peng, et al.
Veröffentlicht: (2025)
von: Cai, Peng, et al.
Veröffentlicht: (2025)
Quantifying and Narrowing the Unknown: Interactive Text-to-Video Retrieval via Uncertainty Minimization
von: Zhang, Bingqing, et al.
Veröffentlicht: (2025)
von: Zhang, Bingqing, et al.
Veröffentlicht: (2025)
LiftAvatar: Kinematic-Space Completion for Expression-Controlled 3D Gaussian Avatar Animation
von: Wei, Hualiang, et al.
Veröffentlicht: (2026)
von: Wei, Hualiang, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
VideoMind: An Omni-Modal Video Dataset with Intent Grounding for Deep-Cognitive Video Understanding
von: Yang, Baoyao, et al.
Veröffentlicht: (2025) -
Leveraging OpenFlamingo for Multimodal Embedding Analysis of C2C Car Parts Data
von: Rashid, Maisha Binte, et al.
Veröffentlicht: (2025) -
Evaluating Perspectival Biases in Cross-Modal Retrieval
von: Saengsukhiran, Teerapol, et al.
Veröffentlicht: (2025) -
A Grounded Memory System For Smart Personal Assistants
von: Ocker, Felix, et al.
Veröffentlicht: (2025) -
TriAlignGR: Triangular Multitask Alignment with Multimodal Deep Interest Mining for Generative Recommendation
von: Zeng, Yangchen, et al.
Veröffentlicht: (2026)