Number it: Temporal Grounding Videos like Flipping Manga
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wu, Yongliang, Hu, Xinting, Sun, Yuyang, Zhou, Yizhou, Zhu, Wenbo, Rao, Fengyun, Schiele, Bernt, Yang, Xu |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
KRIS-Bench: Benchmarking Next-Level Intelligent Image Editing Models
par: Wu, Yongliang, et autres
Publié: (2025)
par: Wu, Yongliang, et autres
Publié: (2025)
MTA-CLIP: Language-Guided Semantic Segmentation with Mask-Text Alignment
par: Das, Anurag, et autres
Publié: (2024)
par: Das, Anurag, et autres
Publié: (2024)
PersonaHOI: Effortlessly Improving Personalized Face with Human-Object Interaction Generation
par: Hu, Xinting, et autres
Publié: (2025)
par: Hu, Xinting, et autres
Publié: (2025)
Do Instance Priors Help Weakly Supervised Semantic Segmentation?
par: Das, Anurag, et autres
Publié: (2026)
par: Das, Anurag, et autres
Publié: (2026)
Towards Better Understanding Attribution Methods
par: Rao, Sukrut, et autres
Publié: (2022)
par: Rao, Sukrut, et autres
Publié: (2022)
Better Understanding Differences in Attribution Methods via Systematic Evaluations
par: Rao, Sukrut, et autres
Publié: (2023)
par: Rao, Sukrut, et autres
Publié: (2023)
Adversarial Training against Location-Optimized Adversarial Patches
par: Rao, Sukrut, et autres
Publié: (2020)
par: Rao, Sukrut, et autres
Publié: (2020)
Unlearning Concepts in Diffusion Model via Concept Domain Correction and Concept Preserving Gradient
par: Wu, Yongliang, et autres
Publié: (2024)
par: Wu, Yongliang, et autres
Publié: (2024)
HarmonySet: A Comprehensive Dataset for Understanding Video-Music Semantic Alignment and Temporal Synchronization
par: Zhou, Zitang, et autres
Publié: (2025)
par: Zhou, Zitang, et autres
Publié: (2025)
Temporal Evidence Routing with Structured Visual Evidence for TimeLogicQA
par: Sun, Yuyang, et autres
Publié: (2026)
par: Sun, Yuyang, et autres
Publié: (2026)
Adaptive Dense Evidence Refinement for Video Relational Reasoning for VRR-QA Challenge
par: Sun, Yuyang, et autres
Publié: (2026)
par: Sun, Yuyang, et autres
Publié: (2026)
Temporal Concept Dynamics in Diffusion Models via Prompt-Conditioned Interventions
par: Gorgun, Ada, et autres
Publié: (2025)
par: Gorgun, Ada, et autres
Publié: (2025)
B-cosification: Transforming Deep Neural Networks to be Inherently Interpretable
par: Arya, Shreyash, et autres
Publié: (2024)
par: Arya, Shreyash, et autres
Publié: (2024)
Discover-then-Name: Task-Agnostic Concept Bottlenecks via Automated Concept Discovery
par: Rao, Sukrut, et autres
Publié: (2024)
par: Rao, Sukrut, et autres
Publié: (2024)
OrCo: Towards Better Generalization via Orthogonality and Contrast for Few-Shot Class-Incremental Learning
par: Ahmed, Noor, et autres
Publié: (2024)
par: Ahmed, Noor, et autres
Publié: (2024)
DWDN: Deep Wiener Deconvolution Network for Non-Blind Image Deblurring
par: Dong, Jiangxin, et autres
Publié: (2021)
par: Dong, Jiangxin, et autres
Publié: (2021)
VITAL: More Understandable Feature Visualization through Distribution Alignment and Relevant Information Flow
par: Gorgun, Ada, et autres
Publié: (2025)
par: Gorgun, Ada, et autres
Publié: (2025)
MASRA: MLLM-Assisted Semantic-Relational Consistent Alignment for Video Temporal Grounding
par: Ran, Ran, et autres
Publié: (2026)
par: Ran, Ran, et autres
Publié: (2026)
Unbiasing through Textual Descriptions: Mitigating Representation Bias in Video Benchmarks
par: Shvetsova, Nina, et autres
Publié: (2025)
par: Shvetsova, Nina, et autres
Publié: (2025)
VEU-Bench: Towards Comprehensive Understanding of Video Editing
par: Li, Bozheng, et autres
Publié: (2025)
par: Li, Bozheng, et autres
Publié: (2025)
Studying How to Efficiently and Effectively Guide Models with Explanations
par: Rao, Sukrut, et autres
Publié: (2023)
par: Rao, Sukrut, et autres
Publié: (2023)
Good Teachers Explain: Explanation-Enhanced Knowledge Distillation
par: Parchami-Araghi, Amin, et autres
Publié: (2024)
par: Parchami-Araghi, Amin, et autres
Publié: (2024)
FaCT: Faithful Concept Traces for Explaining Neural Network Decisions
par: Parchami-Araghi, Amin, et autres
Publié: (2025)
par: Parchami-Araghi, Amin, et autres
Publié: (2025)
Optimising for Interpretability: Convolutional Dynamic Alignment Networks
par: Böhle, Moritz, et autres
Publié: (2021)
par: Böhle, Moritz, et autres
Publié: (2021)
ReGenNet: Towards Human Action-Reaction Synthesis
par: Xu, Liang, et autres
Publié: (2024)
par: Xu, Liang, et autres
Publié: (2024)
FlexSelect: Flexible Token Selection for Efficient Long Video Understanding
par: Zhang, Yunzhu, et autres
Publié: (2025)
par: Zhang, Yunzhu, et autres
Publié: (2025)
HowToCaption: Prompting LLMs to Transform Video Annotations at Scale
par: Shvetsova, Nina, et autres
Publié: (2023)
par: Shvetsova, Nina, et autres
Publié: (2023)
MMAR: Towards Lossless Multi-Modal Auto-Regressive Probabilistic Modeling
par: Yang, Jian, et autres
Publié: (2024)
par: Yang, Jian, et autres
Publié: (2024)
Walker: Self-supervised Multiple Object Tracking by Walking on Temporal Appearance Graphs
par: Segu, Mattia, et autres
Publié: (2024)
par: Segu, Mattia, et autres
Publié: (2024)
ClipTTT: CLIP-Guided Test-Time Training Helps LVLMs See Better
par: Nath, Mriganka, et autres
Publié: (2026)
par: Nath, Mriganka, et autres
Publié: (2026)
B-cos Alignment for Inherently Interpretable CNNs and Vision Transformers
par: Böhle, Moritz, et autres
Publié: (2023)
par: Böhle, Moritz, et autres
Publié: (2023)
AIM: Amending Inherent Interpretability via Self-Supervised Masking
par: Alshami, Eyad, et autres
Publié: (2025)
par: Alshami, Eyad, et autres
Publié: (2025)
How to Probe: Simple Yet Effective Techniques for Improving Post-hoc Explanations
par: Gairola, Siddhartha, et autres
Publié: (2025)
par: Gairola, Siddhartha, et autres
Publié: (2025)
MTR++: Multi-Agent Motion Prediction with Symmetric Scene Modeling and Guided Intention Querying
par: Shi, Shaoshuai, et autres
Publié: (2023)
par: Shi, Shaoshuai, et autres
Publié: (2023)
Moment Quantization for Video Temporal Grounding
par: Sun, Xiaolong, et autres
Publié: (2025)
par: Sun, Xiaolong, et autres
Publié: (2025)
CFM: Language-aligned Concept Foundation Model for Vision
par: Wittenmayer, Kai, et autres
Publié: (2026)
par: Wittenmayer, Kai, et autres
Publié: (2026)
SimNP: Learning Self-Similarity Priors Between Neural Points
par: Wewer, Christopher, et autres
Publié: (2023)
par: Wewer, Christopher, et autres
Publié: (2023)
Sp2360: Sparse-view 360 Scene Reconstruction using Cascaded 2D Diffusion Priors
par: Paul, Soumava, et autres
Publié: (2024)
par: Paul, Soumava, et autres
Publié: (2024)
Reframe Anything: LLM Agent for Open World Video Reframing
par: Cao, Jiawang, et autres
Publié: (2024)
par: Cao, Jiawang, et autres
Publié: (2024)
Adaptive Hierarchical Certification for Segmentation using Randomized Smoothing
par: Anani, Alaa, et autres
Publié: (2024)
par: Anani, Alaa, et autres
Publié: (2024)
Documents similaires
-
KRIS-Bench: Benchmarking Next-Level Intelligent Image Editing Models
par: Wu, Yongliang, et autres
Publié: (2025) -
MTA-CLIP: Language-Guided Semantic Segmentation with Mask-Text Alignment
par: Das, Anurag, et autres
Publié: (2024) -
PersonaHOI: Effortlessly Improving Personalized Face with Human-Object Interaction Generation
par: Hu, Xinting, et autres
Publié: (2025) -
Do Instance Priors Help Weakly Supervised Semantic Segmentation?
par: Das, Anurag, et autres
Publié: (2026) -
Towards Better Understanding Attribution Methods
par: Rao, Sukrut, et autres
Publié: (2022)