LUST: A Multi-Modal Framework with Hierarchical LLM-based Scoring for Learned Thematic Significance Tracking in Multimedia Content
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Luiz, Anderson de Lima |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Text2midi-InferAlign: Improving Symbolic Music Generation with Inference-Time Alignment
par: Roy, Abhinaba, et autres
Publié: (2025)
par: Roy, Abhinaba, et autres
Publié: (2025)
Step-Aware Residual-Guided Diffusion for EEG Spatial Super-Resolution
par: Liu, Hongjun, et autres
Publié: (2025)
par: Liu, Hongjun, et autres
Publié: (2025)
M2D-CLAP: Masked Modeling Duo Meets CLAP for Learning General-purpose Audio-Language Representation
par: Niizumi, Daisuke, et autres
Publié: (2024)
par: Niizumi, Daisuke, et autres
Publié: (2024)
Influence-Inspired Spectral Rotations for Extreme Low-Bit LLM Quantization
par: Pavlov, Gorgi
Publié: (2026)
par: Pavlov, Gorgi
Publié: (2026)
OPENXRD: A Comprehensive Benchmark Framework for LLM/MLLM XRD Question Answering
par: Vosoughi, Ali, et autres
Publié: (2025)
par: Vosoughi, Ali, et autres
Publié: (2025)
Agent-Centric Personalized Multiple Clustering with Multi-Modal LLMs
par: Chen, Ziye, et autres
Publié: (2025)
par: Chen, Ziye, et autres
Publié: (2025)
Can Sound Replace Vision in LLaVA With Token Substitution?
par: Vosoughi, Ali, et autres
Publié: (2025)
par: Vosoughi, Ali, et autres
Publié: (2025)
Centralized vs. Decentralized Multi-Agent Reinforcement Learning for Enhanced Control of Electric Vehicle Charging Networks
par: Shojaeighadikolaei, Amin, et autres
Publié: (2024)
par: Shojaeighadikolaei, Amin, et autres
Publié: (2024)
Contestable Multi-Agent Debate with Arena-based Argumentative Computation for Multimedia Verification
par: Nguyen, Truong Thanh Hung, et autres
Publié: (2026)
par: Nguyen, Truong Thanh Hung, et autres
Publié: (2026)
Detecting Misinformation in Multimedia Content through Cross-Modal Entity Consistency: A Dual Learning Approach
par: Fu, Zhe, et autres
Publié: (2024)
par: Fu, Zhe, et autres
Publié: (2024)
Rethinking Masking Strategies for Masked Prediction-based Audio Self-supervised Learning
par: Niizumi, Daisuke, et autres
Publié: (2026)
par: Niizumi, Daisuke, et autres
Publié: (2026)
Score Distillation Sampling for Audio: Source Separation, Synthesis, and Beyond
par: Richter-Powell, Jessie, et autres
Publié: (2025)
par: Richter-Powell, Jessie, et autres
Publié: (2025)
Marrying Compressed Sensing and Deep Signal Separation
par: Hickok, Truman, et autres
Publié: (2024)
par: Hickok, Truman, et autres
Publié: (2024)
TrackGPT -- A generative pre-trained transformer for cross-domain entity trajectory forecasting
par: Stroh, Nicholas
Publié: (2024)
par: Stroh, Nicholas
Publié: (2024)
From Features to Graphs: Exploring Graph Structures and Pairwise Interactions via GNNs
par: Yamchote, Phaphontee, et autres
Publié: (2025)
par: Yamchote, Phaphontee, et autres
Publié: (2025)
WARP -- Web-Augmented Real-time Program Repairer: A Real-Time Compilation Error Resolution using LLMs and Web-Augmented Synthesis
par: Luiz, Anderson de Lima
Publié: (2025)
par: Luiz, Anderson de Lima
Publié: (2025)
Harmful Visual Content Manipulation Matters in Misinformation Detection Under Multimedia Scenarios
par: Wang, Bing, et autres
Publié: (2026)
par: Wang, Bing, et autres
Publié: (2026)
A review on Machine Learning based User-Centric Multimedia Streaming Techniques
par: Ghosh, Monalisa, et autres
Publié: (2024)
par: Ghosh, Monalisa, et autres
Publié: (2024)
ADAM: An AI Reasoning and Bioinformatics Model for Alzheimer's Disease Detection and Microbiome-Clinical Data Integration
par: Huang, Ziyuan, et autres
Publié: (2025)
par: Huang, Ziyuan, et autres
Publié: (2025)
Generative Design of a Gas Turbine Combustor Using Invertible Neural Networks
par: Krüger, Patrick, et autres
Publié: (2026)
par: Krüger, Patrick, et autres
Publié: (2026)
Rainbow Delay Compensation: A Multi-Agent Reinforcement Learning Framework for Mitigating Delayed Observation
par: Fu, Songchen, et autres
Publié: (2025)
par: Fu, Songchen, et autres
Publié: (2025)
Faked Speech Detection with Zero Prior Knowledge
par: Ajmi, Sahar Al, et autres
Publié: (2022)
par: Ajmi, Sahar Al, et autres
Publié: (2022)
Project Synapse: A Hierarchical Multi-Agent Framework with Hybrid Memory for Autonomous Resolution of Last-Mile Delivery Disruptions
par: Yadav, Arin Gopalan, et autres
Publié: (2026)
par: Yadav, Arin Gopalan, et autres
Publié: (2026)
MMTB: Evaluating Terminal Agents on Multimedia-File Tasks
par: Heo, Chiyeong, et autres
Publié: (2026)
par: Heo, Chiyeong, et autres
Publié: (2026)
MetaCheckGPT -- A Multi-task Hallucination Detector Using LLM Uncertainty and Meta-models
par: Mehta, Rahul, et autres
Publié: (2024)
par: Mehta, Rahul, et autres
Publié: (2024)
Integrating Attendance Tracking and Emotion Detection for Enhanced Student Engagement in Smart Classrooms
par: Ainebyona, Keith, et autres
Publié: (2026)
par: Ainebyona, Keith, et autres
Publié: (2026)
Attention Maps in 3D Shape Classification for Dental Stage Estimation with Class Node Graph Attention Networks
par: Buyukcakir, Barkin, et autres
Publié: (2025)
par: Buyukcakir, Barkin, et autres
Publié: (2025)
CLIP-Guided Backdoor Defense through Entropy-Based Poisoned Dataset Separation
par: Xu, Binyan, et autres
Publié: (2025)
par: Xu, Binyan, et autres
Publié: (2025)
CentaurTA Studio: A Self-Improving Human-Agent Collaboration System for Thematic Analysis
par: Wang, Lei, et autres
Publié: (2026)
par: Wang, Lei, et autres
Publié: (2026)
A Survey on Music Generation from Single-Modal, Cross-Modal, and Multi-Modal Perspectives
par: Li, Shuyu, et autres
Publié: (2025)
par: Li, Shuyu, et autres
Publié: (2025)
Harmony: A Unified Framework for Modality Incremental Learning
par: Song, Yaguang, et autres
Publié: (2025)
par: Song, Yaguang, et autres
Publié: (2025)
Machine Learning-Driven Open-Source Framework for Assessing QoE in Multimedia Networks
par: Panahi, Parsa Hassani Shariat, et autres
Publié: (2024)
par: Panahi, Parsa Hassani Shariat, et autres
Publié: (2024)
3ET: Efficient Event-based Eye Tracking using a Change-Based ConvLSTM Network
par: Chen, Qinyu, et autres
Publié: (2023)
par: Chen, Qinyu, et autres
Publié: (2023)
A Vulnerability of Attribution Methods Using Pre-Softmax Scores
par: Lerma, Miguel, et autres
Publié: (2023)
par: Lerma, Miguel, et autres
Publié: (2023)
OmniDPO: A Preference Optimization Framework to Address Omni-Modal Hallucination
par: Chen, Junzhe, et autres
Publié: (2025)
par: Chen, Junzhe, et autres
Publié: (2025)
SafeAgent: Safeguarding LLM Agents via an Automated Risk Simulator
par: Zhou, Xueyang, et autres
Publié: (2025)
par: Zhou, Xueyang, et autres
Publié: (2025)
rETF-semiSL: Semi-Supervised Learning for Neural Collapse in Temporal Data
par: Xie, Yuhan, et autres
Publié: (2025)
par: Xie, Yuhan, et autres
Publié: (2025)
A Rhetorical Relations-Based Framework for Tailored Multimedia Document Summarization
par: Maredj, Azze-Eddine, et autres
Publié: (2024)
par: Maredj, Azze-Eddine, et autres
Publié: (2024)
SonicMaster: Towards Controllable All-in-One Music Restoration and Mastering
par: Melechovsky, Jan, et autres
Publié: (2025)
par: Melechovsky, Jan, et autres
Publié: (2025)
AG-REPA: Causal Layer Selection for Representation Alignment in Audio Flow Matching
par: Zhang, Pengfei, et autres
Publié: (2026)
par: Zhang, Pengfei, et autres
Publié: (2026)
Documents similaires
-
Text2midi-InferAlign: Improving Symbolic Music Generation with Inference-Time Alignment
par: Roy, Abhinaba, et autres
Publié: (2025) -
Step-Aware Residual-Guided Diffusion for EEG Spatial Super-Resolution
par: Liu, Hongjun, et autres
Publié: (2025) -
M2D-CLAP: Masked Modeling Duo Meets CLAP for Learning General-purpose Audio-Language Representation
par: Niizumi, Daisuke, et autres
Publié: (2024) -
Influence-Inspired Spectral Rotations for Extreme Low-Bit LLM Quantization
par: Pavlov, Gorgi
Publié: (2026) -
OPENXRD: A Comprehensive Benchmark Framework for LLM/MLLM XRD Question Answering
par: Vosoughi, Ali, et autres
Publié: (2025)