CoachMe: Decoding Sport Elements with a Reference-Based Coaching Instruction Generation Model
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yeh, Wei-Hsin, Su, Yu-An, Chen, Chih-Ning, Lin, Yi-Hsueh, Ku, Calvin, Chiu, Wen-Hsin, Hu, Min-Chun, Ku, Lun-Wei |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Spatially-Aware Speaker for Vision-and-Language Navigation Instruction Generation
par: Gopinathan, Muraleekrishna, et autres
Publié: (2024)
par: Gopinathan, Muraleekrishna, et autres
Publié: (2024)
PhysicsArena: The First Multimodal Physics Reasoning Benchmark Exploring Variable, Process, and Solution Dimensions
par: Dai, Song, et autres
Publié: (2025)
par: Dai, Song, et autres
Publié: (2025)
Game-RL: Synthesizing Multimodal Verifiable Game Data to Boost VLMs' General Reasoning
par: Tong, Jingqi, et autres
Publié: (2025)
par: Tong, Jingqi, et autres
Publié: (2025)
ICG: Improving Cover Image Generation via MLLM-based Prompting and Personalized Preference Alignment
par: Bian, Zhipeng, et autres
Publié: (2026)
par: Bian, Zhipeng, et autres
Publié: (2026)
More Than Meets the Eye: Measuring the Semiotic Gap in Vision-Language Models via Semantic Anchorage
par: He, Wei
Publié: (2026)
par: He, Wei
Publié: (2026)
Learning the meanings of function words from grounded language using a visual question answering model
par: Portelance, Eva, et autres
Publié: (2023)
par: Portelance, Eva, et autres
Publié: (2023)
Physics-R1: An Audited Olympiad Corpus and Recipe for Visual Physics Reasoning
par: Yang, Shan
Publié: (2026)
par: Yang, Shan
Publié: (2026)
Enhancing Sports Strategy with Video Analytics and Data Mining: Assessing the effectiveness of Multimodal LLMs in tennis video analysis
par: Teo, Charlton
Publié: (2025)
par: Teo, Charlton
Publié: (2025)
OpenMap: Instruction Grounding via Open-Vocabulary Visual-Language Mapping
par: Li, Danyang, et autres
Publié: (2025)
par: Li, Danyang, et autres
Publié: (2025)
StratXplore: Strategic Novelty-seeking and Instruction-aligned Exploration for Vision and Language Navigation
par: Gopinathan, Muraleekrishna, et autres
Publié: (2024)
par: Gopinathan, Muraleekrishna, et autres
Publié: (2024)
MemeCraft: Contextual and Stance-Driven Multimodal Meme Generation
par: Wang, Han, et autres
Publié: (2024)
par: Wang, Han, et autres
Publié: (2024)
Cinéaste: A Fine-grained Contextual Movie Question Answering Benchmark
par: Shah, Nisarg A., et autres
Publié: (2025)
par: Shah, Nisarg A., et autres
Publié: (2025)
ReSpace: Text-Driven Autoregressive 3D Indoor Scene Synthesis and Editing
par: Bucher, Martin JJ., et autres
Publié: (2025)
par: Bucher, Martin JJ., et autres
Publié: (2025)
A Closer Look at Bias and Chain-of-Thought Faithfulness of Large (Vision) Language Models
par: Balasubramanian, Sriram, et autres
Publié: (2025)
par: Balasubramanian, Sriram, et autres
Publié: (2025)
From Benchmarking to Reasoning: A Dual-Aspect, Large-Scale Evaluation of LLMs on Vietnamese Legal Text
par: Le, Van-Truong
Publié: (2026)
par: Le, Van-Truong
Publié: (2026)
VidNum-1.4K: A Comprehensive Benchmark for Video-based Numerical Reasoning
par: Cui, Shaoyang, et autres
Publié: (2026)
par: Cui, Shaoyang, et autres
Publié: (2026)
Defending against Backdoor Attacks via Module Switching
par: Li, Weijun, et autres
Publié: (2025)
par: Li, Weijun, et autres
Publié: (2025)
Enhanced Kalman with Adaptive Appearance Motion SORT for Grounded Generic Multiple Object Tracking
par: Anh, Duy Le Dinh, et autres
Publié: (2024)
par: Anh, Duy Le Dinh, et autres
Publié: (2024)
What Makes a Good Story and How Can We Measure It? A Comprehensive Survey of Story Evaluation
par: Yang, Dingyi, et autres
Publié: (2024)
par: Yang, Dingyi, et autres
Publié: (2024)
Reframing linguistic bootstrapping as joint inference using visually-grounded grammar induction models
par: Portelance, Eva, et autres
Publié: (2024)
par: Portelance, Eva, et autres
Publié: (2024)
GroundCap: A Visually Grounded Image Captioning Dataset
par: Oliveira, Daniel A. P., et autres
Publié: (2025)
par: Oliveira, Daniel A. P., et autres
Publié: (2025)
Relative Drawing Identification Complexity is Invariant to Modality in Vision-Language Models
par: Freitas, Diogo, et autres
Publié: (2025)
par: Freitas, Diogo, et autres
Publié: (2025)
StoryReasoning Dataset: Using Chain-of-Thought for Scene Understanding and Grounded Story Generation
par: Oliveira, Daniel A. P., et autres
Publié: (2025)
par: Oliveira, Daniel A. P., et autres
Publié: (2025)
Towards Explainable Fake Image Detection with Multi-Modal Large Language Models
par: Ji, Yikun, et autres
Publié: (2025)
par: Ji, Yikun, et autres
Publié: (2025)
Beyond Localization: A Comprehensive Diagnosis of Perspective-Conditioned Spatial Reasoning in MLLMs from Omnidirectional Images
par: Chen, Yuangong, et autres
Publié: (2026)
par: Chen, Yuangong, et autres
Publié: (2026)
WISE: A World Knowledge-Informed Semantic Evaluation for Text-to-Image Generation
par: Niu, Yuwei, et autres
Publié: (2025)
par: Niu, Yuwei, et autres
Publié: (2025)
Taking Flight with Dialogue: Enabling Natural Language Control for PX4-based Drone Agent
par: Lim, Shoon Kit, et autres
Publié: (2025)
par: Lim, Shoon Kit, et autres
Publié: (2025)
Emo3D: Metric and Benchmarking Dataset for 3D Facial Expression Generation from Emotion Description
par: Dehghani, Mahshid, et autres
Publié: (2024)
par: Dehghani, Mahshid, et autres
Publié: (2024)
MIRA: Empowering One-Touch AI Services on Smartphones with MLLM-based Instruction Recommendation
par: Bian, Zhipeng, et autres
Publié: (2025)
par: Bian, Zhipeng, et autres
Publié: (2025)
Universal Adversarial Attack on Aligned Multimodal LLMs
par: Rahmatullaev, Temurbek, et autres
Publié: (2025)
par: Rahmatullaev, Temurbek, et autres
Publié: (2025)
Memory-Efficient Differentially Private Training with Gradient Random Projection
par: Mulrooney, Alex, et autres
Publié: (2025)
par: Mulrooney, Alex, et autres
Publié: (2025)
PhysNote: Self-Knowledge Notes for Evolvable Physical Reasoning in Vision-Language Model
par: Zhang, Sinin, et autres
Publié: (2026)
par: Zhang, Sinin, et autres
Publié: (2026)
K-MetBench: A Multi-Dimensional Benchmark for Fine-Grained Evaluation of Expert Reasoning, Locality, and Multimodality in Meteorology
par: Kim, Soyeon, et autres
Publié: (2026)
par: Kim, Soyeon, et autres
Publié: (2026)
Bounding Hallucinations: Information-Theoretic Guarantees for RAG Systems via Merlin-Arthur Protocols
par: Deiseroth, Björn, et autres
Publié: (2025)
par: Deiseroth, Björn, et autres
Publié: (2025)
Story Generation from Visual Inputs: Techniques, Related Tasks, and Challenges
par: Oliveira, Daniel A. P., et autres
Publié: (2024)
par: Oliveira, Daniel A. P., et autres
Publié: (2024)
HuMoCon: Concept Discovery for Human Motion Understanding
par: Fang, Qihang, et autres
Publié: (2025)
par: Fang, Qihang, et autres
Publié: (2025)
Beyond Visual Understanding: Introducing PARROT-360V for Vision Language Model Benchmarking
par: Khurdula, Harsha Vardhan, et autres
Publié: (2024)
par: Khurdula, Harsha Vardhan, et autres
Publié: (2024)
RoboScript: Code Generation for Free-Form Manipulation Tasks across Real and Simulation
par: Chen, Junting, et autres
Publié: (2024)
par: Chen, Junting, et autres
Publié: (2024)
SpatialMath: Spatial Comprehension-Infused Symbolic Reasoning for Mathematical Problem-Solving
par: Bajpai, Ashutosh, et autres
Publié: (2026)
par: Bajpai, Ashutosh, et autres
Publié: (2026)
On the Limitations of Vision-Language Models in Understanding Image Transforms
par: Anis, Ahmad Mustafa, et autres
Publié: (2025)
par: Anis, Ahmad Mustafa, et autres
Publié: (2025)
Documents similaires
-
Spatially-Aware Speaker for Vision-and-Language Navigation Instruction Generation
par: Gopinathan, Muraleekrishna, et autres
Publié: (2024) -
PhysicsArena: The First Multimodal Physics Reasoning Benchmark Exploring Variable, Process, and Solution Dimensions
par: Dai, Song, et autres
Publié: (2025) -
Game-RL: Synthesizing Multimodal Verifiable Game Data to Boost VLMs' General Reasoning
par: Tong, Jingqi, et autres
Publié: (2025) -
ICG: Improving Cover Image Generation via MLLM-based Prompting and Personalized Preference Alignment
par: Bian, Zhipeng, et autres
Publié: (2026) -
More Than Meets the Eye: Measuring the Semiotic Gap in Vision-Language Models via Semantic Anchorage
par: He, Wei
Publié: (2026)