MobiDiary: Autoregressive Action Captioning with Wearable Devices and Wireless Signals
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Deng, Fei, He, Yinghui, Chu, Chuntong, Wang, Ge, Ding, Han, Han, Jinsong, Wang, Fei |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
XRF V2: A Dataset for Action Summarization with Wi-Fi Signals, and IMUs in Phones, Watches, Earbuds, and Glasses
par: Lan, Bo, et autres
Publié: (2025)
par: Lan, Bo, et autres
Publié: (2025)
Talk is Not Always Cheap: Promoting Wireless Sensing Models with Text Prompts
par: Yang, Zhenkui, et autres
Publié: (2025)
par: Yang, Zhenkui, et autres
Publié: (2025)
What's on Your Plate? Inferring Chinese Cuisine Intake from Wearable IMUs
par: Yin, Jiaxi, et autres
Publié: (2025)
par: Yin, Jiaxi, et autres
Publié: (2025)
HiLoTs: High-Low Temporal Sensitive Representation Learning for Semi-Supervised LiDAR Segmentation in Autonomous Driving
par: Lin, R. D., et autres
Publié: (2025)
par: Lin, R. D., et autres
Publié: (2025)
mmEgoHand: Egocentric Hand Pose Estimation and Gesture Recognition with Head-mounted Millimeter-wave Radar and IMU
par: Lv, Yizhe, et autres
Publié: (2025)
par: Lv, Yizhe, et autres
Publié: (2025)
WS-IMUBench: Can Weakly Supervised Methods from Audio, Image, and Video Be Adapted for IMU-based Temporal Action Localization?
par: Li, Pei, et autres
Publié: (2026)
par: Li, Pei, et autres
Publié: (2026)
A Survey on Wi-Fi Sensing Generalizability: Taxonomy, Techniques, Datasets, and Future Research Prospects
par: Wang, Fei, et autres
Publié: (2025)
par: Wang, Fei, et autres
Publié: (2025)
One Snapshot is All You Need: A Generalized Method for mmWave Signal Generation
par: Huang, Teng, et autres
Publié: (2025)
par: Huang, Teng, et autres
Publié: (2025)
Continuous Speculative Decoding for Autoregressive Image Generation
par: Wang, Zili, et autres
Publié: (2024)
par: Wang, Zili, et autres
Publié: (2024)
Fine-Grained Captioning of Long Videos through Scene Graph Consolidation
par: Chu, Sanghyeok, et autres
Publié: (2025)
par: Chu, Sanghyeok, et autres
Publié: (2025)
Cross-domain EEG-based Emotion Recognition with Contrastive Learning
par: Yan, Rui, et autres
Publié: (2025)
par: Yan, Rui, et autres
Publié: (2025)
An Adaptive System for Wearable Devices to Detect Stress Using Physiological Signals
par: Xu, Gelei, et autres
Publié: (2024)
par: Xu, Gelei, et autres
Publié: (2024)
Exploiting Discriminative Codebook Prior for Autoregressive Image Generation
par: Tang, Longxiang, et autres
Publié: (2025)
par: Tang, Longxiang, et autres
Publié: (2025)
DMSD-CDFSAR: Distillation from Mixed-Source Domain for Cross-Domain Few-shot Action Recognition
par: Guo, Fei, et autres
Publié: (2024)
par: Guo, Fei, et autres
Publié: (2024)
Segment and Caption Anything
par: Huang, Xiaoke, et autres
Publié: (2023)
par: Huang, Xiaoke, et autres
Publié: (2023)
LINA: Linear Autoregressive Image Generative Models with Continuous Tokens
par: Wang, Jiahao, et autres
Publié: (2026)
par: Wang, Jiahao, et autres
Publié: (2026)
LucidFlux: Caption-Free Photo-Realistic Image Restoration via a Large-Scale Diffusion Transformer
par: Fei, Song, et autres
Publié: (2025)
par: Fei, Song, et autres
Publié: (2025)
Mitigating Image Captioning Hallucinations in Vision-Language Models
par: Zhao, Fei, et autres
Publié: (2025)
par: Zhao, Fei, et autres
Publié: (2025)
Panoptic Captioning: An Equivalence Bridge for Image and Text
par: Lin, Kun-Yu, et autres
Publié: (2025)
par: Lin, Kun-Yu, et autres
Publié: (2025)
Autoregressive Sequence Modeling for 3D Medical Image Representation
par: Wang, Siwen, et autres
Publié: (2024)
par: Wang, Siwen, et autres
Publié: (2024)
Multi-view Distillation based on Multi-modal Fusion for Few-shot Action Recognition(CLIP-$\mathrm{M^2}$DF)
par: Guo, Fei, et autres
Publié: (2024)
par: Guo, Fei, et autres
Publié: (2024)
GEM-VPC: A dual Graph-Enhanced Multimodal integration for Video Paragraph Captioning
par: Wang, Eileen, et autres
Publié: (2024)
par: Wang, Eileen, et autres
Publié: (2024)
PacTure: Efficient PBR Texture Generation on Packed Views with Visual Autoregressive Models
par: Fei, Fan, et autres
Publié: (2025)
par: Fei, Fan, et autres
Publié: (2025)
Data-efficient Large Vision Models through Sequential Autoregression
par: Guo, Jianyuan, et autres
Publié: (2024)
par: Guo, Jianyuan, et autres
Publié: (2024)
MobiAct: Efficient MAV Action Recognition Using MobileNetV4 with Contrastive Learning and Knowledge Distillation
par: Nengbo, Zhang, et autres
Publié: (2025)
par: Nengbo, Zhang, et autres
Publié: (2025)
FluentAvatar: Flicker-Free Talking-Head Animation via Phoneme-Guided Autoregressive Modeling
par: Deng, Yuchen, et autres
Publié: (2025)
par: Deng, Yuchen, et autres
Publié: (2025)
Physical Autoregressive Model for Robotic Manipulation without Action Pretraining
par: Song, Zijian, et autres
Publié: (2025)
par: Song, Zijian, et autres
Publié: (2025)
Reflective Human-Machine Co-adaptation for Enhanced Text-to-Image Generation Dialogue System
par: Feng, Yuheng, et autres
Publié: (2024)
par: Feng, Yuheng, et autres
Publié: (2024)
Multimodal Skeleton-Based Action Representation Learning via Decomposition and Composition
par: Wang, Hongsong, et autres
Publié: (2025)
par: Wang, Hongsong, et autres
Publié: (2025)
Infinity-RoPE: Action-Controllable Infinite Video Generation Emerges From Autoregressive Self-Rollout
par: Yesiltepe, Hidir, et autres
Publié: (2025)
par: Yesiltepe, Hidir, et autres
Publié: (2025)
Autoregressive Image Generation without Vector Quantization
par: Li, Tianhong, et autres
Publié: (2024)
par: Li, Tianhong, et autres
Publié: (2024)
Any2Caption:Interpreting Any Condition to Caption for Controllable Video Generation
par: Wu, Shengqiong, et autres
Publié: (2025)
par: Wu, Shengqiong, et autres
Publié: (2025)
CLIP-SCGI: Synthesized Caption-Guided Inversion for Person Re-Identification
par: Han, Qianru, et autres
Publié: (2024)
par: Han, Qianru, et autres
Publié: (2024)
Coordinate-Based Dual-Constrained Autoregressive Motion Generation
par: Ding, Kang, et autres
Publié: (2026)
par: Ding, Kang, et autres
Publié: (2026)
SharpNet: Enhancing MLPs to Represent Functions with Controlled Non-differentiability
par: Niu, Hanting, et autres
Publié: (2026)
par: Niu, Hanting, et autres
Publié: (2026)
2S-UDF: A Novel Two-stage UDF Learning Method for Robust Non-watertight Model Reconstruction from Multi-view Images
par: Deng, Junkai, et autres
Publié: (2023)
par: Deng, Junkai, et autres
Publié: (2023)
Randomized Autoregressive Visual Generation
par: Yu, Qihang, et autres
Publié: (2024)
par: Yu, Qihang, et autres
Publié: (2024)
Dense Policy: Bidirectional Autoregressive Learning of Actions
par: Su, Yue, et autres
Publié: (2025)
par: Su, Yue, et autres
Publié: (2025)
Shot2Tactic-Caption: Multi-Scale Captioning of Badminton Videos for Tactical Understanding
par: Ding, Ning, et autres
Publié: (2025)
par: Ding, Ning, et autres
Publié: (2025)
Implicit and Explicit Commonsense for Multi-sentence Video Captioning
par: Chou, Shih-Han, et autres
Publié: (2023)
par: Chou, Shih-Han, et autres
Publié: (2023)
Documents similaires
-
XRF V2: A Dataset for Action Summarization with Wi-Fi Signals, and IMUs in Phones, Watches, Earbuds, and Glasses
par: Lan, Bo, et autres
Publié: (2025) -
Talk is Not Always Cheap: Promoting Wireless Sensing Models with Text Prompts
par: Yang, Zhenkui, et autres
Publié: (2025) -
What's on Your Plate? Inferring Chinese Cuisine Intake from Wearable IMUs
par: Yin, Jiaxi, et autres
Publié: (2025) -
HiLoTs: High-Low Temporal Sensitive Representation Learning for Semi-Supervised LiDAR Segmentation in Autonomous Driving
par: Lin, R. D., et autres
Publié: (2025) -
mmEgoHand: Egocentric Hand Pose Estimation and Gesture Recognition with Head-mounted Millimeter-wave Radar and IMU
par: Lv, Yizhe, et autres
Publié: (2025)