Salvato in:
| Autori principali: | Yang, Baoyao, Chen, Junxiang, Li, Wanyun, Yao, Wenbin, Zhou, Yang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2502.02885 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VideoMind: An Omni-Modal Video Dataset with Intent Grounding for Deep-Cognitive Video Understanding
di: Yang, Baoyao, et al.
Pubblicazione: (2025)
di: Yang, Baoyao, et al.
Pubblicazione: (2025)
Leveraging OpenFlamingo for Multimodal Embedding Analysis of C2C Car Parts Data
di: Rashid, Maisha Binte, et al.
Pubblicazione: (2025)
di: Rashid, Maisha Binte, et al.
Pubblicazione: (2025)
Evaluating Perspectival Biases in Cross-Modal Retrieval
di: Saengsukhiran, Teerapol, et al.
Pubblicazione: (2025)
di: Saengsukhiran, Teerapol, et al.
Pubblicazione: (2025)
A Grounded Memory System For Smart Personal Assistants
di: Ocker, Felix, et al.
Pubblicazione: (2025)
di: Ocker, Felix, et al.
Pubblicazione: (2025)
TriAlignGR: Triangular Multitask Alignment with Multimodal Deep Interest Mining for Generative Recommendation
di: Zeng, Yangchen, et al.
Pubblicazione: (2026)
di: Zeng, Yangchen, et al.
Pubblicazione: (2026)
Large Language Model for Qualitative Research -- A Systematic Mapping Study
di: Barros, Cauã Ferreira, et al.
Pubblicazione: (2024)
di: Barros, Cauã Ferreira, et al.
Pubblicazione: (2024)
Semantic Reconstruction of Adversarial Plagiarism: A Context-Aware Framework for Detecting and Restoring "Tortured Phrases" in Scientific Literature
di: Maiti, Agniva, et al.
Pubblicazione: (2025)
di: Maiti, Agniva, et al.
Pubblicazione: (2025)
DEUCE: Dual-diversity Enhancement and Uncertainty-awareness for Cold-start Active Learning
di: Guo, Jiaxin, et al.
Pubblicazione: (2025)
di: Guo, Jiaxin, et al.
Pubblicazione: (2025)
An Ensemble Embedding Approach for Improving Semantic Caching Performance in LLM-based Systems
di: Ghaffari, Shervin, et al.
Pubblicazione: (2025)
di: Ghaffari, Shervin, et al.
Pubblicazione: (2025)
ARTAI: An Evaluation Platform to Assess Societal Risk of Recommender Algorithms
di: Ruan, Qin, et al.
Pubblicazione: (2024)
di: Ruan, Qin, et al.
Pubblicazione: (2024)
AI vs. Human Moderators: A Comparative Evaluation of Multimodal LLMs in Content Moderation for Brand Safety
di: Levi, Adi, et al.
Pubblicazione: (2025)
di: Levi, Adi, et al.
Pubblicazione: (2025)
Tensor Manifold-Based Graph-Vector Fusion for AI-Native Academic Literature Retrieval
di: Wei, Xing, et al.
Pubblicazione: (2026)
di: Wei, Xing, et al.
Pubblicazione: (2026)
Visualizing the Evolution of Twitter (X.com) Conversations: A Comprehensive Methodology Applied to AI Training Discussions on ChatGPT
di: Jess, Nicole, et al.
Pubblicazione: (2024)
di: Jess, Nicole, et al.
Pubblicazione: (2024)
Exploring Diagnostic Prompting Approach for Multimodal LLM-based Visual Complexity Assessment: A Case Study of Amazon Search Result Pages
di: Murtadak, Divendar, et al.
Pubblicazione: (2025)
di: Murtadak, Divendar, et al.
Pubblicazione: (2025)
QoSGMAA: A Robust Multi-Order Graph Attention and Adversarial Framework for Sparse QoS Prediction
di: Du, Guanchen, et al.
Pubblicazione: (2025)
di: Du, Guanchen, et al.
Pubblicazione: (2025)
Spatially-Grounded Document Retrieval via Patch-to-Region Relevance Propagation
di: Georgiou, Athos
Pubblicazione: (2025)
di: Georgiou, Athos
Pubblicazione: (2025)
Predicting When to Trust Vision-Language Models for Spatial Reasoning
di: Imran, Muhammad, et al.
Pubblicazione: (2026)
di: Imran, Muhammad, et al.
Pubblicazione: (2026)
ReCoVR: Closing the Loop in Interactive Composed Video Retrieval
di: Zhang, Bingqing, et al.
Pubblicazione: (2026)
di: Zhang, Bingqing, et al.
Pubblicazione: (2026)
FinBERT-QA: Financial Question Answering with pre-trained BERT Language Models
di: Yuan, Bithiah
Pubblicazione: (2025)
di: Yuan, Bithiah
Pubblicazione: (2025)
MoXaRt: Audio-Visual Object-Guided Sound Interaction for XR
di: Xu, Tianyu, et al.
Pubblicazione: (2026)
di: Xu, Tianyu, et al.
Pubblicazione: (2026)
LinkedOut: Linking World Knowledge Representation Out of Video LLM for Next-Generation Video Recommendation
di: Zhang, Haichao, et al.
Pubblicazione: (2025)
di: Zhang, Haichao, et al.
Pubblicazione: (2025)
AVATAAR: Agentic Video Answering via Temporal Adaptive Alignment and Reasoning
di: Patel, Urjitkumar, et al.
Pubblicazione: (2025)
di: Patel, Urjitkumar, et al.
Pubblicazione: (2025)
From Citation Selection to Citation Absorption: A Measurement Framework for Generative Engine Optimization Across AI Search Platforms
di: Kai, Zhang, et al.
Pubblicazione: (2026)
di: Kai, Zhang, et al.
Pubblicazione: (2026)
Dense Video Understanding with Gated Residual Tokenization
di: Zhang, Haichao, et al.
Pubblicazione: (2025)
di: Zhang, Haichao, et al.
Pubblicazione: (2025)
DALL-M: Context-Aware Clinical Data Augmentation with LLMs
di: Hsieh, Chihcheng, et al.
Pubblicazione: (2024)
di: Hsieh, Chihcheng, et al.
Pubblicazione: (2024)
Bottleneck-based Encoder-decoder ARchitecture (BEAR) for Learning Unbiased Consumer-to-Consumer Image Representations
di: Rivas, Pablo, et al.
Pubblicazione: (2024)
di: Rivas, Pablo, et al.
Pubblicazione: (2024)
Higher education assessment practice in the era of generative AI tools
di: Ogunleye, Bayode, et al.
Pubblicazione: (2024)
di: Ogunleye, Bayode, et al.
Pubblicazione: (2024)
Enhancing XR Auditory Realism via Multimodal Scene-Aware Acoustic Rendering
di: Xu, Tianyu, et al.
Pubblicazione: (2025)
di: Xu, Tianyu, et al.
Pubblicazione: (2025)
VOGUE: A Multimodal Dataset for Conversational Recommendation in Fashion
di: Guo, David, et al.
Pubblicazione: (2025)
di: Guo, David, et al.
Pubblicazione: (2025)
Correspondence of high-dimensional emotion structures elicited by video clips between humans and Multimodal LLMs
di: Asanuma, Haruka, et al.
Pubblicazione: (2025)
di: Asanuma, Haruka, et al.
Pubblicazione: (2025)
Experimentation Accelerator: Interpretable Insights and Creative Recommendations for A/B Testing with Content-Aware ranking
di: Hu, Zhengmian, et al.
Pubblicazione: (2026)
di: Hu, Zhengmian, et al.
Pubblicazione: (2026)
CourseTimeQA: A Lecture-Video Benchmark and a Latency-Constrained Cross-Modal Fusion Method for Timestamped QA
di: Kovalev, Vsevolod, et al.
Pubblicazione: (2025)
di: Kovalev, Vsevolod, et al.
Pubblicazione: (2025)
Real-World En Call Center Transcripts Dataset with PII Redaction
di: Dao, Ha, et al.
Pubblicazione: (2025)
di: Dao, Ha, et al.
Pubblicazione: (2025)
ORPHEAS: A Cross-Lingual Greek-English Embedding Model for Retrieval-Augmented Generation
di: Livieris, Ioannis E., et al.
Pubblicazione: (2026)
di: Livieris, Ioannis E., et al.
Pubblicazione: (2026)
HySemRAG: A Hybrid Semantic Retrieval-Augmented Generation Framework for Automated Literature Synthesis and Methodological Gap Analysis
di: Godinez, Alejandro
Pubblicazione: (2025)
di: Godinez, Alejandro
Pubblicazione: (2025)
Incorporating Legal Structure in Retrieval-Augmented Generation: A Case Study on Copyright Fair Use
di: Ho, Justin, et al.
Pubblicazione: (2025)
di: Ho, Justin, et al.
Pubblicazione: (2025)
To Retrieve or Not to Retrieve? Uncertainty Detection for Dynamic Retrieval Augmented Generation
di: Dhole, Kaustubh D.
Pubblicazione: (2025)
di: Dhole, Kaustubh D.
Pubblicazione: (2025)
LLMLogAnalyzer: A Clustering-Based Log Analysis Chatbot using Large Language Models
di: Cai, Peng, et al.
Pubblicazione: (2025)
di: Cai, Peng, et al.
Pubblicazione: (2025)
Quantifying and Narrowing the Unknown: Interactive Text-to-Video Retrieval via Uncertainty Minimization
di: Zhang, Bingqing, et al.
Pubblicazione: (2025)
di: Zhang, Bingqing, et al.
Pubblicazione: (2025)
LiftAvatar: Kinematic-Space Completion for Expression-Controlled 3D Gaussian Avatar Animation
di: Wei, Hualiang, et al.
Pubblicazione: (2026)
di: Wei, Hualiang, et al.
Pubblicazione: (2026)
Documenti analoghi
-
VideoMind: An Omni-Modal Video Dataset with Intent Grounding for Deep-Cognitive Video Understanding
di: Yang, Baoyao, et al.
Pubblicazione: (2025) -
Leveraging OpenFlamingo for Multimodal Embedding Analysis of C2C Car Parts Data
di: Rashid, Maisha Binte, et al.
Pubblicazione: (2025) -
Evaluating Perspectival Biases in Cross-Modal Retrieval
di: Saengsukhiran, Teerapol, et al.
Pubblicazione: (2025) -
A Grounded Memory System For Smart Personal Assistants
di: Ocker, Felix, et al.
Pubblicazione: (2025) -
TriAlignGR: Triangular Multitask Alignment with Multimodal Deep Interest Mining for Generative Recommendation
di: Zeng, Yangchen, et al.
Pubblicazione: (2026)