Action-Inspired Generative Models
Fuente:
arXiv
Salvato in:
| Autori principali: | A., Eshwar R., Pal, Debnath |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Force Matching with Relativistic Constraints: A Physics-Inspired Approach to Stable and Efficient Generative Modeling
di: Cao, Yang, et al.
Pubblicazione: (2025)
di: Cao, Yang, et al.
Pubblicazione: (2025)
ActionParty: Multi-Subject Action Binding in Generative Video Games
di: Pondaven, Alexander, et al.
Pubblicazione: (2026)
di: Pondaven, Alexander, et al.
Pubblicazione: (2026)
Zero-Shot Action Generalization with Limited Observations
di: Alchihabi, Abdullah, et al.
Pubblicazione: (2025)
di: Alchihabi, Abdullah, et al.
Pubblicazione: (2025)
Towards Generalizing Temporal Action Segmentation to Unseen Views
di: Bahrami, Emad, et al.
Pubblicazione: (2025)
di: Bahrami, Emad, et al.
Pubblicazione: (2025)
Task-conditioned Ensemble of Expert Models for Continuous Learning
di: Sharma, Renu, et al.
Pubblicazione: (2025)
di: Sharma, Renu, et al.
Pubblicazione: (2025)
Generative Image as Action Models
di: Shridhar, Mohit, et al.
Pubblicazione: (2024)
di: Shridhar, Mohit, et al.
Pubblicazione: (2024)
FlyPrompt: Brain-Inspired Random-Expanded Routing with Temporal-Ensemble Experts for General Continual Learning
di: Yan, Hongwei, et al.
Pubblicazione: (2026)
di: Yan, Hongwei, et al.
Pubblicazione: (2026)
PhiNet v2: A Mask-Free Brain-Inspired Vision Foundation Model from Video
di: Yamada, Makoto, et al.
Pubblicazione: (2025)
di: Yamada, Makoto, et al.
Pubblicazione: (2025)
Enhancing Generalization in Vision-Language-Action Models by Preserving Pretrained Representations
di: Grover, Shresth, et al.
Pubblicazione: (2025)
di: Grover, Shresth, et al.
Pubblicazione: (2025)
Communication-Inspired Tokenization for Structured Image Representations
di: Davtyan, Aram, et al.
Pubblicazione: (2026)
di: Davtyan, Aram, et al.
Pubblicazione: (2026)
Generative AI in Depth: A Survey of Recent Advances, Model Variants, and Real-World Applications
di: Yazdani, Shamim, et al.
Pubblicazione: (2025)
di: Yazdani, Shamim, et al.
Pubblicazione: (2025)
Vision-Language Models Unlock Task-Centric Latent Actions
di: Nikulin, Alexander, et al.
Pubblicazione: (2026)
di: Nikulin, Alexander, et al.
Pubblicazione: (2026)
Olaf-World: Orienting Latent Actions for Video World Modeling
di: Jiang, Yuxin, et al.
Pubblicazione: (2026)
di: Jiang, Yuxin, et al.
Pubblicazione: (2026)
Action-Agnostic Point-Level Supervision for Temporal Action Detection
di: Yoshida, Shuhei M., et al.
Pubblicazione: (2024)
di: Yoshida, Shuhei M., et al.
Pubblicazione: (2024)
One-Frame Calibration with Siamese Network in Facial Action Unit Recognition
di: Feng, Shuangquan, et al.
Pubblicazione: (2024)
di: Feng, Shuangquan, et al.
Pubblicazione: (2024)
Video Action Differencing
di: Burgess, James, et al.
Pubblicazione: (2025)
di: Burgess, James, et al.
Pubblicazione: (2025)
Beyond FVD: Enhanced Evaluation Metrics for Video Generation Quality
di: Luo, Ge Ya, et al.
Pubblicazione: (2024)
di: Luo, Ge Ya, et al.
Pubblicazione: (2024)
NinA: Normalizing Flows in Action. Training VLA Models with Normalizing Flows
di: Tarasov, Denis, et al.
Pubblicazione: (2025)
di: Tarasov, Denis, et al.
Pubblicazione: (2025)
MM-PoE: Multiple Choice Reasoning via. Process of Elimination using Multi-Modal Models
di: Chakrabarty, Sayak, et al.
Pubblicazione: (2024)
di: Chakrabarty, Sayak, et al.
Pubblicazione: (2024)
Cognitive Science-Inspired Evaluation of Core Capabilities for Object Understanding in AI
di: Rutar, Danaja, et al.
Pubblicazione: (2025)
di: Rutar, Danaja, et al.
Pubblicazione: (2025)
RNNs, CNNs and Transformers in Human Action Recognition: A Survey and a Hybrid Model
di: Alomar, Khaled, et al.
Pubblicazione: (2024)
di: Alomar, Khaled, et al.
Pubblicazione: (2024)
Semantically Guided Action Anticipation
di: Diko, Anxhelo, et al.
Pubblicazione: (2024)
di: Diko, Anxhelo, et al.
Pubblicazione: (2024)
From Spatial to Actions: Grounding Vision-Language-Action Model in Spatial Foundation Priors
di: Zhang, Zhengshen, et al.
Pubblicazione: (2025)
di: Zhang, Zhengshen, et al.
Pubblicazione: (2025)
SkelMamba: A State Space Model for Efficient Skeleton Action Recognition of Neurological Disorders
di: Martinel, Niki, et al.
Pubblicazione: (2024)
di: Martinel, Niki, et al.
Pubblicazione: (2024)
Skeleton-based Action Recognition with Non-linear Dependency Modeling and Hilbert-Schmidt Independence Criterion
di: Yang, Yuheng
Pubblicazione: (2024)
di: Yang, Yuheng
Pubblicazione: (2024)
SOLAMI: Social Vision-Language-Action Modeling for Immersive Interaction with 3D Autonomous Characters
di: Jiang, Jianping, et al.
Pubblicazione: (2024)
di: Jiang, Jianping, et al.
Pubblicazione: (2024)
Conformal uncertainty quantification to evaluate predictive fairness of foundation AI model for skin lesion classes across patient demographics
di: Bhattacharyya, Swarnava, et al.
Pubblicazione: (2025)
di: Bhattacharyya, Swarnava, et al.
Pubblicazione: (2025)
Hybrid Training for Vision-Language-Action Models
di: Mazzaglia, Pietro, et al.
Pubblicazione: (2025)
di: Mazzaglia, Pietro, et al.
Pubblicazione: (2025)
StarFlow: Generating Structured Workflow Outputs From Sketch Images
di: Bechard, Patrice, et al.
Pubblicazione: (2025)
di: Bechard, Patrice, et al.
Pubblicazione: (2025)
Fly-CL: A Fly-Inspired Framework for Enhancing Efficient Decorrelation and Reduced Training Time in Pre-trained Model-based Continual Representation Learning
di: Zou, Heming, et al.
Pubblicazione: (2025)
di: Zou, Heming, et al.
Pubblicazione: (2025)
Feature Hallucination for Self-supervised Action Recognition
di: Wang, Lei, et al.
Pubblicazione: (2025)
di: Wang, Lei, et al.
Pubblicazione: (2025)
Evolving Skeletons: Motion Dynamics in Action Recognition
di: Qiu, Jushang, et al.
Pubblicazione: (2025)
di: Qiu, Jushang, et al.
Pubblicazione: (2025)
Semantically Guided Representation Learning For Action Anticipation
di: Diko, Anxhelo, et al.
Pubblicazione: (2024)
di: Diko, Anxhelo, et al.
Pubblicazione: (2024)
A Survey on Efficient Vision-Language-Action Models
di: Yu, Zhaoshu, et al.
Pubblicazione: (2025)
di: Yu, Zhaoshu, et al.
Pubblicazione: (2025)
Interactive Post-Training for Vision-Language-Action Models
di: Tan, Shuhan, et al.
Pubblicazione: (2025)
di: Tan, Shuhan, et al.
Pubblicazione: (2025)
Compositional Entailment Learning for Hyperbolic Vision-Language Models
di: Pal, Avik, et al.
Pubblicazione: (2024)
di: Pal, Avik, et al.
Pubblicazione: (2024)
Latent Action Learning Requires Supervision in the Presence of Distractors
di: Nikulin, Alexander, et al.
Pubblicazione: (2025)
di: Nikulin, Alexander, et al.
Pubblicazione: (2025)
VISAGE: Video Synthesis using Action Graphs for Surgery
di: Yeganeh, Yousef, et al.
Pubblicazione: (2024)
di: Yeganeh, Yousef, et al.
Pubblicazione: (2024)
Real-Time Human Action Recognition on Embedded Platforms
di: Wang, Ruiqi, et al.
Pubblicazione: (2024)
di: Wang, Ruiqi, et al.
Pubblicazione: (2024)
About Time: Advances, Challenges, and Outlooks of Action Understanding
di: Stergiou, Alexandros, et al.
Pubblicazione: (2024)
di: Stergiou, Alexandros, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Force Matching with Relativistic Constraints: A Physics-Inspired Approach to Stable and Efficient Generative Modeling
di: Cao, Yang, et al.
Pubblicazione: (2025) -
ActionParty: Multi-Subject Action Binding in Generative Video Games
di: Pondaven, Alexander, et al.
Pubblicazione: (2026) -
Zero-Shot Action Generalization with Limited Observations
di: Alchihabi, Abdullah, et al.
Pubblicazione: (2025) -
Towards Generalizing Temporal Action Segmentation to Unseen Views
di: Bahrami, Emad, et al.
Pubblicazione: (2025) -
Task-conditioned Ensemble of Expert Models for Continuous Learning
di: Sharma, Renu, et al.
Pubblicazione: (2025)