LumiVideo: An Intelligent Agentic System for Video Color Grading
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Guo, Yuchen, Gong, Junli, Cai, Hongmin, Cheung, Yiu-ming, Su, Weifeng |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Can Segmentation Models Understand the World? Towards Proactive Affordance Reasoning via Visual Chain-of-Thought
par: Guo, Yuchen, et autres
Publié: (2026)
par: Guo, Yuchen, et autres
Publié: (2026)
Fuse4Seg: Image Fusion for Multi-Modal Medical Segmentation via Bi-level Optimization
par: Guo, Yuchen, et autres
Publié: (2024)
par: Guo, Yuchen, et autres
Publié: (2024)
Adding Thermal Awareness to Visual Systems in Real-Time via Distilled Diffusion Models
par: Guo, Yuchen, et autres
Publié: (2026)
par: Guo, Yuchen, et autres
Publié: (2026)
PEAM: Parametric Embodied Agent Memory through Contrastive Internalization of Experience in Minecraft
par: Guo, Yuchen, et autres
Publié: (2026)
par: Guo, Yuchen, et autres
Publié: (2026)
Ask, Attend, Attack: A Effective Decision-Based Black-Box Targeted Attack for Image-to-Text Models
par: Zeng, Qingyuan, et autres
Publié: (2024)
par: Zeng, Qingyuan, et autres
Publié: (2024)
Agentic Video Intelligence: A Flexible Framework for Advanced Video Exploration and Understanding
par: Gao, Hong, et autres
Publié: (2025)
par: Gao, Hong, et autres
Publié: (2025)
Epistemic Uncertainty for Generated Image Detection
par: Nie, Jun, et autres
Publié: (2024)
par: Nie, Jun, et autres
Publié: (2024)
Adjusting Logit in Gaussian Form for Long-Tailed Visual Recognition
par: Li, Mengke, et autres
Publié: (2023)
par: Li, Mengke, et autres
Publié: (2023)
Preacher: Paper-to-Video Agentic System
par: Liu, Jingwei, et autres
Publié: (2025)
par: Liu, Jingwei, et autres
Publié: (2025)
DAE-Fuse: An Adaptive Discriminative Autoencoder for Multi-Modality Image Fusion
par: Guo, Yuchen, et autres
Publié: (2024)
par: Guo, Yuchen, et autres
Publié: (2024)
Bringing Multimodal Large Language Models to Infrared-Visible Image Fusion Quality Assessment
par: Guo, Yuchen, et autres
Publié: (2026)
par: Guo, Yuchen, et autres
Publié: (2026)
VideoThinker: Building Agentic VideoLLMs with LLM-Guided Tool Reasoning
par: Li, Chenglin, et autres
Publié: (2026)
par: Li, Chenglin, et autres
Publié: (2026)
VideoTemp-o3: Harmonizing Temporal Grounding and Video Understanding in Agentic Thinking-with-Videos
par: Liu, Wenqi, et autres
Publié: (2026)
par: Liu, Wenqi, et autres
Publié: (2026)
VideoExplorer: Think With Videos For Agentic Long-Video Understanding
par: Yuan, Huaying, et autres
Publié: (2025)
par: Yuan, Huaying, et autres
Publié: (2025)
TYrPPG: Uncomplicated and Enhanced Learning Capability rPPG for Remote Heart Rate Estimation
par: Chen, Taixi, et autres
Publié: (2025)
par: Chen, Taixi, et autres
Publié: (2025)
LensWalk: Agentic Video Understanding by Planning How You See in Videos
par: Li, Keliang, et autres
Publié: (2026)
par: Li, Keliang, et autres
Publié: (2026)
Deep Video Discovery: Agentic Search with Tool Use for Long-form Video Understanding
par: Zhang, Xiaoyi, et autres
Publié: (2025)
par: Zhang, Xiaoyi, et autres
Publié: (2025)
LumiSculpt: Enabling Consistent Portrait Lighting in Video Generation
par: Zhang, Yuxin, et autres
Publié: (2024)
par: Zhang, Yuxin, et autres
Publié: (2024)
VidEvent: A Large Dataset for Understanding Dynamic Evolution of Events in Videos
par: Liang, Baoyu, et autres
Publié: (2025)
par: Liang, Baoyu, et autres
Publié: (2025)
VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation
par: Zhao, Yiming, et autres
Publié: (2026)
par: Zhao, Yiming, et autres
Publié: (2026)
Prompt-based Consistent Video Colorization
par: Dani, Silvia, et autres
Publié: (2025)
par: Dani, Silvia, et autres
Publié: (2025)
VideoSEAL: Mitigating Evidence Misalignment in Agentic Long Video Understanding by Decoupling Answer Authority
par: Qiu, Chenhao, et autres
Publié: (2026)
par: Qiu, Chenhao, et autres
Publié: (2026)
Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models
par: Wang, Haibo, et autres
Publié: (2024)
par: Wang, Haibo, et autres
Publié: (2024)
Watching, Reasoning, and Searching: A Video Deep Research Benchmark on Open Web for Agentic Video Reasoning
par: Liu, Chengwen, et autres
Publié: (2026)
par: Liu, Chengwen, et autres
Publié: (2026)
AVA: Towards Agentic Video Analytics with Vision Language Models
par: Yan, Yuxuan, et autres
Publié: (2025)
par: Yan, Yuxuan, et autres
Publié: (2025)
GV-VAD : Exploring Video Generation for Weakly-Supervised Video Anomaly Detection
par: Cai, Suhang, et autres
Publié: (2025)
par: Cai, Suhang, et autres
Publié: (2025)
MMSI-Video-Bench: A Holistic Benchmark for Video-Based Spatial Intelligence
par: Lin, Jingli, et autres
Publié: (2025)
par: Lin, Jingli, et autres
Publié: (2025)
Video4Spatial: Towards Visuospatial Intelligence with Context-Guided Video Generation
par: Xiao, Zeqi, et autres
Publié: (2025)
par: Xiao, Zeqi, et autres
Publié: (2025)
Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding
par: Wang, Ziyang, et autres
Publié: (2025)
par: Wang, Ziyang, et autres
Publié: (2025)
Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding
par: Yuan, Liping, et autres
Publié: (2025)
par: Yuan, Liping, et autres
Publié: (2025)
DiffusionAgent: Navigating Expert Models for Agentic Image Generation
par: Qin, Jie, et autres
Publié: (2024)
par: Qin, Jie, et autres
Publié: (2024)
Auto-US: An Ultrasound Video Diagnosis Agent Using Video Classification Framework and LLMs
par: Yang, Yuezhe, et autres
Publié: (2025)
par: Yang, Yuezhe, et autres
Publié: (2025)
A$^2$RD: Agentic Autoregressive Diffusion for Long Video Consistency
par: Long, Do Xuan, et autres
Publié: (2026)
par: Long, Do Xuan, et autres
Publié: (2026)
Video-T1: Test-Time Scaling for Video Generation
par: Liu, Fangfu, et autres
Publié: (2025)
par: Liu, Fangfu, et autres
Publié: (2025)
VideoMAR: Autoregressive Video Generatio with Continuous Tokens
par: Yu, Hu, et autres
Publié: (2025)
par: Yu, Hu, et autres
Publié: (2025)
Weakly Supervised Gaussian Contrastive Grounding with Large Multimodal Models for Video Question Answering
par: Wang, Haibo, et autres
Publié: (2024)
par: Wang, Haibo, et autres
Publié: (2024)
Think over Trajectories: Leveraging Video Generation to Reconstruct GPS Trajectories from Cellular Signaling
par: Zhang, Ruixing, et autres
Publié: (2026)
par: Zhang, Ruixing, et autres
Publié: (2026)
MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering
par: Dang, Jisheng, et autres
Publié: (2025)
par: Dang, Jisheng, et autres
Publié: (2025)
MAVEN: A Multi-stage Agentic Annotation Pipeline for Video Reasoning Tasks
par: Zhang, Han, et autres
Publié: (2026)
par: Zhang, Han, et autres
Publié: (2026)
Visual Agentic Memory: Enabling Online Long Video Understanding via Online Indexing, Hierarchical Memory, and Agentic Retrieval
par: Li, Aiden Yiliu, et autres
Publié: (2026)
par: Li, Aiden Yiliu, et autres
Publié: (2026)
Documents similaires
-
Can Segmentation Models Understand the World? Towards Proactive Affordance Reasoning via Visual Chain-of-Thought
par: Guo, Yuchen, et autres
Publié: (2026) -
Fuse4Seg: Image Fusion for Multi-Modal Medical Segmentation via Bi-level Optimization
par: Guo, Yuchen, et autres
Publié: (2024) -
Adding Thermal Awareness to Visual Systems in Real-Time via Distilled Diffusion Models
par: Guo, Yuchen, et autres
Publié: (2026) -
PEAM: Parametric Embodied Agent Memory through Contrastive Internalization of Experience in Minecraft
par: Guo, Yuchen, et autres
Publié: (2026) -
Ask, Attend, Attack: A Effective Decision-Based Black-Box Targeted Attack for Image-to-Text Models
par: Zeng, Qingyuan, et autres
Publié: (2024)