Learning Multiple Object States from Actions via Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Tateno, Masatoshi, Yagi, Takuma, Furuta, Ryosuke, Sato, Yoichi |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
HanDyVQA: A Video QA Benchmark for Fine-Grained Hand-Object Interaction Dynamics
par: Tateno, Masatoshi, et autres
Publié: (2025)
par: Tateno, Masatoshi, et autres
Publié: (2025)
Seeking Flat Minima with Mean Teacher on Semi- and Weakly-Supervised Domain Generalization for Object Detection
par: Furuta, Ryosuke, et autres
Publié: (2023)
par: Furuta, Ryosuke, et autres
Publié: (2023)
ActionVOS: Actions as Prompts for Video Object Segmentation
par: Ouyang, Liangyang, et autres
Publié: (2024)
par: Ouyang, Liangyang, et autres
Publié: (2024)
FineBio: A Fine-Grained Video Dataset of Biological Experiments with Hierarchical Annotation
par: Yagi, Takuma, et autres
Publié: (2024)
par: Yagi, Takuma, et autres
Publié: (2024)
Exo2EgoDVC: Dense Video Captioning of Egocentric Procedural Activities Using Web Instructional Videos
par: Ohkawa, Takehiko, et autres
Publié: (2023)
par: Ohkawa, Takehiko, et autres
Publié: (2023)
EgoInstruct: An Egocentric Video Dataset of Face-to-face Instructional Interactions with Multi-modal LLM Benchmarking
par: Sakai, Yuki, et autres
Publié: (2025)
par: Sakai, Yuki, et autres
Publié: (2025)
Pre-Training for 3D Hand Pose Estimation with Contrastive Learning on Large-Scale Hand Images in the Wild
par: Lin, Nie, et autres
Publié: (2024)
par: Lin, Nie, et autres
Publié: (2024)
AssemblyHands-X: Modeling 3D Hand-Body Coordination for Understanding Bimanual Human Activities
par: Banno, Tatsuro, et autres
Publié: (2025)
par: Banno, Tatsuro, et autres
Publié: (2025)
Learning Gaussian Data Augmentation in Feature Space for One-shot Object Detection in Manga
par: Taniguchi, Takara, et autres
Publié: (2024)
par: Taniguchi, Takara, et autres
Publié: (2024)
Inference-time Trajectory Optimization for Manga Image Editing
par: Furuta, Ryosuke
Publié: (2026)
par: Furuta, Ryosuke
Publié: (2026)
Leadership Assessment in Pediatric Intensive Care Unit Team Training
par: Ouyang, Liangyang, et autres
Publié: (2025)
par: Ouyang, Liangyang, et autres
Publié: (2025)
Affordance-Guided Diffusion Prior for 3D Hand Reconstruction
par: Suzuki, Naru, et autres
Publié: (2025)
par: Suzuki, Naru, et autres
Publié: (2025)
Multi-speaker Attention Alignment for Multimodal Social Interaction
par: Ouyang, Liangyang, et autres
Publié: (2025)
par: Ouyang, Liangyang, et autres
Publié: (2025)
SiMHand: Mining Similar Hands for Large-Scale 3D Hand Pose Pre-training
par: Lin, Nie, et autres
Publié: (2025)
par: Lin, Nie, et autres
Publié: (2025)
EgoBrain: Synergizing Minds and Eyes For Human Action Understanding
par: Lin, Nie, et autres
Publié: (2025)
par: Lin, Nie, et autres
Publié: (2025)
Bidirectional Action Sequence Learning for Long-term Action Anticipation with Large Language Models
par: Sato, Yuji, et autres
Publié: (2025)
par: Sato, Yuji, et autres
Publié: (2025)
Generative Modeling of Shape-Dependent Self-Contact Human Poses
par: Ohkawa, Takehiko, et autres
Publié: (2025)
par: Ohkawa, Takehiko, et autres
Publié: (2025)
Egocentric Gaze Estimation via Neck-Mounted Camera
par: Huang, Haoyu, et autres
Publié: (2026)
par: Huang, Haoyu, et autres
Publié: (2026)
Egocentric Action-aware Inertial Localization in Point Clouds with Vision-Language Guidance
par: Zhang, Mingfang, et autres
Publié: (2025)
par: Zhang, Mingfang, et autres
Publié: (2025)
Masked Video and Body-worn IMU Autoencoder for Egocentric Action Recognition
par: Zhang, Mingfang, et autres
Publié: (2024)
par: Zhang, Mingfang, et autres
Publié: (2024)
Generative Hierarchical Temporal Transformer for Hand Pose and Action Modeling
par: Wen, Yilin, et autres
Publié: (2023)
par: Wen, Yilin, et autres
Publié: (2023)
Extending Dataset Pruning to Object Detection: A Variance-based Approach
par: Yagi, Ryota
Publié: (2025)
par: Yagi, Ryota
Publié: (2025)
VSRD++: Autolabeling for 3D Object Detection via Instance-Aware Volumetric Silhouette Rendering
par: Liu, Zihua, et autres
Publié: (2025)
par: Liu, Zihua, et autres
Publié: (2025)
VISA: Reasoning Video Object Segmentation via Large Language Models
par: Yan, Cilin, et autres
Publié: (2024)
par: Yan, Cilin, et autres
Publié: (2024)
Zero-shot Action Localization via the Confidence of Large Vision-Language Models
par: Aklilu, Josiah, et autres
Publié: (2024)
par: Aklilu, Josiah, et autres
Publié: (2024)
The N-Body Problem: Parallel Execution from Single-Person Egocentric Video
par: Zhu, Zhifan, et autres
Publié: (2025)
par: Zhu, Zhifan, et autres
Publié: (2025)
Learning to Reason and Navigate: Parameter Efficient Action Planning with Large Language Models
par: Mohammadi, Bahram, et autres
Publié: (2025)
par: Mohammadi, Bahram, et autres
Publié: (2025)
SFHand: Learning Embodied Manipulation by Streaming Egocentric 3D Hand Forecasting
par: Liu, Ruicong, et autres
Publié: (2025)
par: Liu, Ruicong, et autres
Publié: (2025)
CountLLM: Towards Generalizable Repetitive Action Counting via Large Language Model
par: Yao, Ziyu, et autres
Publié: (2025)
par: Yao, Ziyu, et autres
Publié: (2025)
Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models
par: Zhang, Quan, et autres
Publié: (2024)
par: Zhang, Quan, et autres
Publié: (2024)
Language-guided Learning for Object Detection Tackling Multiple Variations in Aerial Images
par: Park, Sungjune, et autres
Publié: (2025)
par: Park, Sungjune, et autres
Publié: (2025)
VSRD: Instance-Aware Volumetric Silhouette Rendering for Weakly Supervised 3D Object Detection
par: Liu, Zihua, et autres
Publié: (2024)
par: Liu, Zihua, et autres
Publié: (2024)
MambaTrack: A Simple Baseline for Multiple Object Tracking with State Space Model
par: Xiao, Changcheng, et autres
Publié: (2024)
par: Xiao, Changcheng, et autres
Publié: (2024)
FairT2I: Mitigating Social Bias in Text-to-Image Generation via Large Language Model-Assisted Detection and Attribute Rebalancing
par: Sakurai, Jinya, et autres
Publié: (2025)
par: Sakurai, Jinya, et autres
Publié: (2025)
Single-to-Dual-View Adaptation for Egocentric 3D Hand Pose Estimation
par: Liu, Ruicong, et autres
Publié: (2024)
par: Liu, Ruicong, et autres
Publié: (2024)
Motion State: A New Benchmark Multiple Object Tracking
par: Feng, Yang, et autres
Publié: (2023)
par: Feng, Yang, et autres
Publié: (2023)
LOME: Learning Human-Object Manipulation with Action-Conditioned Egocentric World Model
par: Gao, Quankai, et autres
Publié: (2026)
par: Gao, Quankai, et autres
Publié: (2026)
Point Linguist Model: Segment Any Object via Bridged Large 3D-Language Model
par: Huang, Zhuoxu, et autres
Publié: (2025)
par: Huang, Zhuoxu, et autres
Publié: (2025)
Nullu: Mitigating Object Hallucinations in Large Vision-Language Models via HalluSpace Projection
par: Yang, Le, et autres
Publié: (2024)
par: Yang, Le, et autres
Publié: (2024)
YOLIC: An Efficient Method for Object Localization and Classification on Edge Devices
par: Su, Kai, et autres
Publié: (2023)
par: Su, Kai, et autres
Publié: (2023)
Documents similaires
-
HanDyVQA: A Video QA Benchmark for Fine-Grained Hand-Object Interaction Dynamics
par: Tateno, Masatoshi, et autres
Publié: (2025) -
Seeking Flat Minima with Mean Teacher on Semi- and Weakly-Supervised Domain Generalization for Object Detection
par: Furuta, Ryosuke, et autres
Publié: (2023) -
ActionVOS: Actions as Prompts for Video Object Segmentation
par: Ouyang, Liangyang, et autres
Publié: (2024) -
FineBio: A Fine-Grained Video Dataset of Biological Experiments with Hierarchical Annotation
par: Yagi, Takuma, et autres
Publié: (2024) -
Exo2EgoDVC: Dense Video Captioning of Egocentric Procedural Activities Using Web Instructional Videos
par: Ohkawa, Takehiko, et autres
Publié: (2023)