Can masking background and object reduce static bias for zero-shot action recognition?
Fuente:
arXiv
Salvato in:
| Autori principali: | Fukuzawa, Takumi, Hara, Kensho, Kataoka, Hirokatsu, Tamaki, Toru |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Human Action Recognition without Human
di: Kataoka, Hirokatsu, et al.
Pubblicazione: (2016)
di: Kataoka, Hirokatsu, et al.
Pubblicazione: (2016)
M3DDM+: An improved video outpainting by a modified masking strategy
di: Murakawa, Takuya, et al.
Pubblicazione: (2026)
di: Murakawa, Takuya, et al.
Pubblicazione: (2026)
Fine-grained length controllable video captioning with ordinal embeddings
di: Nitta, Tomoya, et al.
Pubblicazione: (2024)
di: Nitta, Tomoya, et al.
Pubblicazione: (2024)
Text-guided Synthetic Geometric Augmentation for Zero-shot 3D Understanding
di: Torimi, Kohei, et al.
Pubblicazione: (2025)
di: Torimi, Kohei, et al.
Pubblicazione: (2025)
Multi-model learning by sequential reading of untrimmed videos for action recognition
di: Kamiya, Kodai, et al.
Pubblicazione: (2024)
di: Kamiya, Kodai, et al.
Pubblicazione: (2024)
Formula-Supervised Visual-Geometric Pre-training
di: Yamada, Ryosuke, et al.
Pubblicazione: (2024)
di: Yamada, Ryosuke, et al.
Pubblicazione: (2024)
Simple Visual Artifact Detection in Sora-Generated Videos
di: Sugiyama, Misora, et al.
Pubblicazione: (2025)
di: Sugiyama, Misora, et al.
Pubblicazione: (2025)
Query matching for spatio-temporal action detection with query-based object detector
di: Hori, Shimon, et al.
Pubblicazione: (2024)
di: Hori, Shimon, et al.
Pubblicazione: (2024)
Industrial Synthetic Segment Pre-training
di: Mae, Shinichi, et al.
Pubblicazione: (2025)
di: Mae, Shinichi, et al.
Pubblicazione: (2025)
S3OD: Towards Generalizable Salient Object Detection with Synthetic Data
di: Kupyn, Orest, et al.
Pubblicazione: (2025)
di: Kupyn, Orest, et al.
Pubblicazione: (2025)
Action tube generation by person query matching for spatio-temporal action detection
di: Omi, Kazuki, et al.
Pubblicazione: (2025)
di: Omi, Kazuki, et al.
Pubblicazione: (2025)
Watermark-embedded Adversarial Examples for Copyright Protection against Diffusion Models
di: Zhu, Peifei, et al.
Pubblicazione: (2024)
di: Zhu, Peifei, et al.
Pubblicazione: (2024)
Pre-training with 3D Synthetic Data: Learning 3D Point Cloud Instance Segmentation from 3D Synthetic Scenes
di: Otsuka, Daichi, et al.
Pubblicazione: (2025)
di: Otsuka, Daichi, et al.
Pubblicazione: (2025)
Leveraging LLMs with Iterative Loop Structure for Enhanced Social Intelligence in Video Question Answering
di: Mori, Erika, et al.
Pubblicazione: (2025)
di: Mori, Erika, et al.
Pubblicazione: (2025)
Shift and matching queries for video semantic segmentation
di: Mizuno, Tsubasa, et al.
Pubblicazione: (2024)
di: Mizuno, Tsubasa, et al.
Pubblicazione: (2024)
Reflective Dialogue between Teacher and Solver Agents for Video Question Answering
di: Murakawa, Takuya, et al.
Pubblicazione: (2026)
di: Murakawa, Takuya, et al.
Pubblicazione: (2026)
HanDyVQA: A Video QA Benchmark for Fine-Grained Hand-Object Interaction Dynamics
di: Tateno, Masatoshi, et al.
Pubblicazione: (2025)
di: Tateno, Masatoshi, et al.
Pubblicazione: (2025)
AnimalClue: Recognizing Animals by their Traces
di: Shinoda, Risa, et al.
Pubblicazione: (2025)
di: Shinoda, Risa, et al.
Pubblicazione: (2025)
AgroBench: Vision-Language Model Benchmark in Agriculture
di: Shinoda, Risa, et al.
Pubblicazione: (2025)
di: Shinoda, Risa, et al.
Pubblicazione: (2025)
PowerCLIP: Powerset Alignment for Contrastive Pre-Training
di: Kawamura, Masaki, et al.
Pubblicazione: (2025)
di: Kawamura, Masaki, et al.
Pubblicazione: (2025)
Primitive Geometry Segment Pre-training for 3D Medical Image Segmentation
di: Tadokoro, Ryu, et al.
Pubblicazione: (2024)
di: Tadokoro, Ryu, et al.
Pubblicazione: (2024)
Exploring Limits of Diffusion-Synthetic Training with Weakly Supervised Semantic Segmentation
di: Yoshihashi, Ryota, et al.
Pubblicazione: (2023)
di: Yoshihashi, Ryota, et al.
Pubblicazione: (2023)
Two-stream joint matching method based on contrastive learning for few-shot action recognition
di: Deng, Long, et al.
Pubblicazione: (2024)
di: Deng, Long, et al.
Pubblicazione: (2024)
Can VLMs be used on videos for action recognition? LLMs are Visual Reasoning Coordinators
di: Lunia, Harsh
Pubblicazione: (2024)
di: Lunia, Harsh
Pubblicazione: (2024)
The impact of Compositionality in Zero-shot Multi-label action recognition for Object-based tasks
di: Calabrese, Carmela, et al.
Pubblicazione: (2024)
di: Calabrese, Carmela, et al.
Pubblicazione: (2024)
FDIF: Formula-Driven supervised Learning with Implicit Functions for 3D Medical Image Segmentation
di: Yamamoto, Yukinori, et al.
Pubblicazione: (2026)
di: Yamamoto, Yukinori, et al.
Pubblicazione: (2026)
MoExDA: Domain Adaptation for Edge-based Action Recognition
di: Sugimoto, Takuya, et al.
Pubblicazione: (2025)
di: Sugimoto, Takuya, et al.
Pubblicazione: (2025)
Shot2Tactic-Caption: Multi-Scale Captioning of Badminton Videos for Tactical Understanding
di: Ding, Ning, et al.
Pubblicazione: (2025)
di: Ding, Ning, et al.
Pubblicazione: (2025)
Disentangling Static and Dynamic Information for Reducing Static Bias in Action Recognition
di: Kobayashi, Masato, et al.
Pubblicazione: (2025)
di: Kobayashi, Masato, et al.
Pubblicazione: (2025)
BFMD: A Full-Match Badminton Dense Dataset for Dense Shot Captioning
di: Ding, Ning, et al.
Pubblicazione: (2026)
di: Ding, Ning, et al.
Pubblicazione: (2026)
Online pre-training with long-form videos
di: Kato, Itsuki, et al.
Pubblicazione: (2024)
di: Kato, Itsuki, et al.
Pubblicazione: (2024)
MoireDB: Formula-generated Interference-fringe Image Dataset
di: Matsuo, Yuto, et al.
Pubblicazione: (2025)
di: Matsuo, Yuto, et al.
Pubblicazione: (2025)
Can the accuracy bias by facial hairstyle be reduced through balancing the training data?
di: Ozturk, Kagan, et al.
Pubblicazione: (2024)
di: Ozturk, Kagan, et al.
Pubblicazione: (2024)
Constant Rate Scheduling: A General Framework for Optimizing Diffusion Noise Schedule via Distributional Change
di: Okada, Shuntaro, et al.
Pubblicazione: (2024)
di: Okada, Shuntaro, et al.
Pubblicazione: (2024)
3D sans 3D Scans: Scalable Pre-training from Video-Generated Point Clouds
di: Yamada, Ryousuke, et al.
Pubblicazione: (2025)
di: Yamada, Ryousuke, et al.
Pubblicazione: (2025)
Separating Shared and Domain-Specific LoRAs for Multi-Domain Learning
di: Takama, Yusaku, et al.
Pubblicazione: (2025)
di: Takama, Yusaku, et al.
Pubblicazione: (2025)
On the Relationship Between Double Descent of CNNs and Shape/Texture Bias Under Learning Process
di: Iwase, Shun, et al.
Pubblicazione: (2025)
di: Iwase, Shun, et al.
Pubblicazione: (2025)
CLIP-like Model as a Foundational Density Ratio Estimator
di: Uchiyama, Fumiya, et al.
Pubblicazione: (2025)
di: Uchiyama, Fumiya, et al.
Pubblicazione: (2025)
Egocentric zone-aware action recognition across environments
di: Peirone, Simone Alberto, et al.
Pubblicazione: (2024)
di: Peirone, Simone Alberto, et al.
Pubblicazione: (2024)
3DFlowRenderer: One-shot Face Re-enactment via Dense 3D Facial Flow Estimation
di: Nijhawan, Siddharth, et al.
Pubblicazione: (2024)
di: Nijhawan, Siddharth, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Human Action Recognition without Human
di: Kataoka, Hirokatsu, et al.
Pubblicazione: (2016) -
M3DDM+: An improved video outpainting by a modified masking strategy
di: Murakawa, Takuya, et al.
Pubblicazione: (2026) -
Fine-grained length controllable video captioning with ordinal embeddings
di: Nitta, Tomoya, et al.
Pubblicazione: (2024) -
Text-guided Synthetic Geometric Augmentation for Zero-shot 3D Understanding
di: Torimi, Kohei, et al.
Pubblicazione: (2025) -
Multi-model learning by sequential reading of untrimmed videos for action recognition
di: Kamiya, Kodai, et al.
Pubblicazione: (2024)