SToLa: Self-Adaptive Touch-Language Framework with Tactile Commonsense Reasoning in Open-Ended Scenarios
Fuente:
arXiv
Guardado en:
| Autores principales: | Cheng, Ning, Xu, Jinan, Chen, Jialing, Fang, Bin, Han, Wenjuan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Towards Comprehensive Multimodal Perception: Introducing the Touch-Language-Vision Dataset
por: Cheng, Ning, et al.
Publicado: (2024)
por: Cheng, Ning, et al.
Publicado: (2024)
AnyTouch 2: General Optical Tactile Representation Learning For Dynamic Tactile Perception
por: Feng, Ruoxuan, et al.
Publicado: (2026)
por: Feng, Ruoxuan, et al.
Publicado: (2026)
Open-Det: An Efficient Learning Framework for Open-Ended Detection
por: Cao, Guiping, et al.
Publicado: (2025)
por: Cao, Guiping, et al.
Publicado: (2025)
OpenREAD: Reinforced Open-Ended Reasoning for End-to-End Autonomous Driving with LLM-as-Critic
por: Zhang, Songyan, et al.
Publicado: (2025)
por: Zhang, Songyan, et al.
Publicado: (2025)
ALGO: Object-Grounded Visual Commonsense Reasoning for Open-World Egocentric Action Recognition
por: Kundu, Sanjoy, et al.
Publicado: (2024)
por: Kundu, Sanjoy, et al.
Publicado: (2024)
Generative Region-Language Pretraining for Open-Ended Object Detection
por: Lin, Chuang, et al.
Publicado: (2024)
por: Lin, Chuang, et al.
Publicado: (2024)
Seeing Through Touch: Tactile-Driven Visual Localization of Material Regions
por: Kim, Seongyu, et al.
Publicado: (2026)
por: Kim, Seongyu, et al.
Publicado: (2026)
VitaTouch: Property-Aware Vision-Tactile-Language Model for Robotic Quality Inspection in Manufacturing
por: Zong, Junyi, et al.
Publicado: (2026)
por: Zong, Junyi, et al.
Publicado: (2026)
Touch-R1: Reinforcing Touch Reasoning in MLLMs
por: Lai, Yingxin, et al.
Publicado: (2026)
por: Lai, Yingxin, et al.
Publicado: (2026)
Binding Touch to Everything: Learning Unified Multimodal Tactile Representations
por: Yang, Fengyu, et al.
Publicado: (2024)
por: Yang, Fengyu, et al.
Publicado: (2024)
Ranking Distillation for Open-Ended Video Question Answering with Insufficient Labels
por: Liang, Tianming, et al.
Publicado: (2024)
por: Liang, Tianming, et al.
Publicado: (2024)
Causal Debiasing for Visual Commonsense Reasoning
por: Zou, Jiayi, et al.
Publicado: (2025)
por: Zou, Jiayi, et al.
Publicado: (2025)
Discovering Novel Actions from Open World Egocentric Videos with Object-Grounded Visual Commonsense Reasoning
por: Kundu, Sanjoy, et al.
Publicado: (2023)
por: Kundu, Sanjoy, et al.
Publicado: (2023)
Touch-GS: Visual-Tactile Supervised 3D Gaussian Splatting
por: Swann, Aiden, et al.
Publicado: (2024)
por: Swann, Aiden, et al.
Publicado: (2024)
E.T. Bench: Towards Open-Ended Event-Level Video-Language Understanding
por: Liu, Ye, et al.
Publicado: (2024)
por: Liu, Ye, et al.
Publicado: (2024)
Robust Disentangled Counterfactual Learning for Physical Audiovisual Commonsense Reasoning
por: Qi, Mengshi, et al.
Publicado: (2025)
por: Qi, Mengshi, et al.
Publicado: (2025)
AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding
por: Xu, Weili, et al.
Publicado: (2025)
por: Xu, Weili, et al.
Publicado: (2025)
Activating Visual Context and Commonsense Reasoning through Masked Prediction in VLMs
por: Yu, Jiaao, et al.
Publicado: (2025)
por: Yu, Jiaao, et al.
Publicado: (2025)
Towards Open-Ended Visual Scientific Discovery with Sparse Autoencoders
por: Stevens, Samuel, et al.
Publicado: (2025)
por: Stevens, Samuel, et al.
Publicado: (2025)
PuzzleWorld: A Benchmark for Multimodal, Open-Ended Reasoning in Puzzlehunts
por: Li, Hengzhi, et al.
Publicado: (2025)
por: Li, Hengzhi, et al.
Publicado: (2025)
Gemini in Reasoning: Unveiling Commonsense in Multimodal Large Language Models
por: Wang, Yuqing, et al.
Publicado: (2023)
por: Wang, Yuqing, et al.
Publicado: (2023)
Implicit and Explicit Commonsense for Multi-sentence Video Captioning
por: Chou, Shih-Han, et al.
Publicado: (2023)
por: Chou, Shih-Han, et al.
Publicado: (2023)
M-Tuning: Prompt Tuning with Mitigated Label Bias in Open-Set Scenarios
por: Liao, Ning, et al.
Publicado: (2023)
por: Liao, Ning, et al.
Publicado: (2023)
Open-Ended Instruction Realization with LLM-Enabled Multi-Planner Scheduling in Autonomous Vehicles
por: Liu, Jiawei, et al.
Publicado: (2026)
por: Liu, Jiawei, et al.
Publicado: (2026)
Hierarchical Auto-Organizing System for Open-Ended Multi-Agent Navigation
por: Zhao, Zhonghan, et al.
Publicado: (2024)
por: Zhao, Zhonghan, et al.
Publicado: (2024)
MediX-R1: Open Ended Medical Reinforcement Learning
por: Mullappilly, Sahal Shaji, et al.
Publicado: (2026)
por: Mullappilly, Sahal Shaji, et al.
Publicado: (2026)
IRIS: Intent Resolution via Inference-time Saccades for Open-Ended VQA in Large Vision-Language Models
por: Madinei, Parsa, et al.
Publicado: (2026)
por: Madinei, Parsa, et al.
Publicado: (2026)
AutoOcc: Automatic Open-Ended Semantic Occupancy Annotation via Vision-Language Guided Gaussian Splatting
por: Zhou, Xiaoyu, et al.
Publicado: (2025)
por: Zhou, Xiaoyu, et al.
Publicado: (2025)
MCU: An Evaluation Framework for Open-Ended Game Agents
por: Zheng, Xinyue, et al.
Publicado: (2023)
por: Zheng, Xinyue, et al.
Publicado: (2023)
Benchmarking Vision, Language, & Action Models in Procedurally Generated, Open Ended Action Environments
por: Guruprasad, Pranav, et al.
Publicado: (2025)
por: Guruprasad, Pranav, et al.
Publicado: (2025)
From Plans to Pixels: Learning to Plan and Orchestrate for Open-Ended Image Editing
por: Rajan, Anirudh Sundara, et al.
Publicado: (2026)
por: Rajan, Anirudh Sundara, et al.
Publicado: (2026)
Training-Free Open-Ended Object Detection and Segmentation via Attention as Prompts
por: Lin, Zhiwei, et al.
Publicado: (2024)
por: Lin, Zhiwei, et al.
Publicado: (2024)
AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question Answering
por: Chen, Xiuyuan, et al.
Publicado: (2023)
por: Chen, Xiuyuan, et al.
Publicado: (2023)
A Study of Commonsense Reasoning over Visual Object Properties
por: Kolari, Abhishek, et al.
Publicado: (2025)
por: Kolari, Abhishek, et al.
Publicado: (2025)
Commonsense Prototype for Outdoor Unsupervised 3D Object Detection
por: Wu, Hai, et al.
Publicado: (2024)
por: Wu, Hai, et al.
Publicado: (2024)
SToRe3D: Sparse Token Relevance in ViTs for Efficient Multi-View 3D Object Detection
por: Papais, Sandro, et al.
Publicado: (2026)
por: Papais, Sandro, et al.
Publicado: (2026)
Bootstrap Fine-Grained Vision-Language Alignment for Unified Zero-Shot Anomaly Localization
por: Deng, Hanqiu, et al.
Publicado: (2023)
por: Deng, Hanqiu, et al.
Publicado: (2023)
ViCor: Bridging Visual Understanding and Commonsense Reasoning with Large Language Models
por: Zhou, Kaiwen, et al.
Publicado: (2023)
por: Zhou, Kaiwen, et al.
Publicado: (2023)
MovieRecapsQA: A Multimodal Open-Ended Video Question-Answering Benchmark
por: Shaar, Shaden, et al.
Publicado: (2026)
por: Shaar, Shaden, et al.
Publicado: (2026)
UniPCB: A Unified Vision-Language Benchmark for Open-Ended PCB Quality Inspection
por: Sun, Fuxiang, et al.
Publicado: (2026)
por: Sun, Fuxiang, et al.
Publicado: (2026)
Ejemplares similares
-
Towards Comprehensive Multimodal Perception: Introducing the Touch-Language-Vision Dataset
por: Cheng, Ning, et al.
Publicado: (2024) -
AnyTouch 2: General Optical Tactile Representation Learning For Dynamic Tactile Perception
por: Feng, Ruoxuan, et al.
Publicado: (2026) -
Open-Det: An Efficient Learning Framework for Open-Ended Detection
por: Cao, Guiping, et al.
Publicado: (2025) -
OpenREAD: Reinforced Open-Ended Reasoning for End-to-End Autonomous Driving with LLM-as-Critic
por: Zhang, Songyan, et al.
Publicado: (2025) -
ALGO: Object-Grounded Visual Commonsense Reasoning for Open-World Egocentric Action Recognition
por: Kundu, Sanjoy, et al.
Publicado: (2024)