Enregistré dans:
| Auteurs principaux: | Zhang, Jiahui, Chen, Yurui, Zhou, Yanpeng, Xu, Yueming, Huang, Ze, Mei, Jilin, Chen, Junhui, Yuan, Yu-Jie, Cai, Xinyue, Huang, Guowei, Quan, Xingyue, Xu, Hang, Zhang, Li |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2503.22976 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
4D-VLA: Spatiotemporal Vision-Language-Action Pretraining with Cross-Scene Calibration
par: Zhang, Jiahui, et autres
Publié: (2025)
par: Zhang, Jiahui, et autres
Publié: (2025)
UniUGG: Unified 3D Understanding and Generation via Geometric-Semantic Encoding
par: Xu, Yueming, et autres
Publié: (2025)
par: Xu, Yueming, et autres
Publié: (2025)
GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions
par: Huang, Helong, et autres
Publié: (2025)
par: Huang, Helong, et autres
Publié: (2025)
Whole-Body Inverse Kinematics with Graph Diffusion
par: Huang, Helong, et autres
Publié: (2026)
par: Huang, Helong, et autres
Publié: (2026)
RADAR: Revealing Asymmetric Development of Abilities in MLLM Pre-training
par: Nie, Yunshuang, et autres
Publié: (2026)
par: Nie, Yunshuang, et autres
Publié: (2026)
Beyond Flatlands: Unlocking Spatial Intelligence by Decoupling 3D Reasoning from Numerical Regression
par: Guo, Zhongbin, et autres
Publié: (2025)
par: Guo, Zhongbin, et autres
Publié: (2025)
A Computer Vision Problem in Flatland
par: Agarwal, Sameer, et autres
Publié: (2025)
par: Agarwal, Sameer, et autres
Publié: (2025)
Self-CriTeach: LLM Self-Teaching and Self-Critiquing for Improving Robotic Planning via Automated Domain Generation
par: Huang, Jinbang, et autres
Publié: (2025)
par: Huang, Jinbang, et autres
Publié: (2025)
Scale‐Invariant Waveguiding in Flatland
par: Zhixia Xu, et autres
Publié: (2026)
par: Zhixia Xu, et autres
Publié: (2026)
Circular Isoptics in Flatland
par: Thomas, Alexander
Publié: (2025)
par: Thomas, Alexander
Publié: (2025)
Reason2Drive: Towards Interpretable and Chain-based Reasoning for Autonomous Driving
par: Nie, Ming, et autres
Publié: (2023)
par: Nie, Ming, et autres
Publié: (2023)
LaneCorrect: Self-supervised Lane Detection
par: Nie, Ming, et autres
Publié: (2024)
par: Nie, Ming, et autres
Publié: (2024)
Can Vision-Language Models be a Good Guesser? Exploring VLMs for Times and Location Reasoning
par: Zhang, Gengyuan, et autres
Publié: (2023)
par: Zhang, Gengyuan, et autres
Publié: (2023)
ForceFlow: Learning to Feel and Act via Contact-Driven Flow Matching
par: Zhang, Shuoheng, et autres
Publié: (2026)
par: Zhang, Shuoheng, et autres
Publié: (2026)
Ru Single Atoms Integrated into Cobalt Oxide Spinel Structure with Interstitial Carbon for Enhanced Electrocatalytic Water Oxidation
par: Guowei Wang, et autres
Publié: (2024)
par: Guowei Wang, et autres
Publié: (2024)
Observation of Analog Flatland Cherenkov Radiations on Metasurfaces (Laser Photonics Rev. 18(2)/2024)
par: Zhixia Xu, et autres
Publié: (2024)
par: Zhixia Xu, et autres
Publié: (2024)
SpatialCoT: Advancing Spatial Reasoning through Coordinate Alignment and Chain-of-Thought for Embodied Task Planning
par: Liu, Yuecheng, et autres
Publié: (2025)
par: Liu, Yuecheng, et autres
Publié: (2025)
Prompting CO 2 Electroreduction to Ethanol by Iron Group Metal Ion Dopants Induced Multi‐sites at the Interface of SnSe/SnSe 2 p–n Heterojunction
par: Xinyue Zheng, et autres
Publié: (2024)
par: Xinyue Zheng, et autres
Publié: (2024)
ANCoEF: Asynchronous Neuromorphic Algorithm/Hardware Co-Exploration Framework with a Fully Asynchronous Simulator
par: Zhang, Jian, et autres
Publié: (2024)
par: Zhang, Jian, et autres
Publié: (2024)
Frontispiece: Scale‐Invariant Waveguiding in Flatland (EXP2 1/2026)
par: Zhixia Xu, et autres
Publié: (2026)
par: Zhixia Xu, et autres
Publié: (2026)
TradeTrap: Are LLM-based Trading Agents Truly Reliable and Faithful?
par: Yan, Lewen, et autres
Publié: (2025)
par: Yan, Lewen, et autres
Publié: (2025)
Copy-Move Forgery Detection and Question Answering for Remote Sensing Image
par: Zhang, Ze, et autres
Publié: (2024)
par: Zhang, Ze, et autres
Publié: (2024)
DeflareMamba: Hierarchical Vision Mamba for Contextually Consistent Lens Flare Removal
par: Huang, Yihang, et autres
Publié: (2025)
par: Huang, Yihang, et autres
Publié: (2025)
Learning Global Hypothesis Space for Enhancing Synergistic Reasoning Chain
par: Zhang, Jiaquan, et autres
Publié: (2026)
par: Zhang, Jiaquan, et autres
Publié: (2026)
Think in Safety: Unveiling and Mitigating Safety Alignment Collapse in Multimodal Large Reasoning Model
par: Lou, Xinyue, et autres
Publié: (2025)
par: Lou, Xinyue, et autres
Publié: (2025)
Reinforcing Action Policies by Prophesying
par: Zhang, Jiahui, et autres
Publié: (2025)
par: Zhang, Jiahui, et autres
Publié: (2025)
WoVoGen: World Volume-aware Diffusion for Controllable Multi-camera Driving Scene Generation
par: Lu, Jiachen, et autres
Publié: (2023)
par: Lu, Jiachen, et autres
Publié: (2023)
OpenOcc: Open Vocabulary 3D Scene Reconstruction via Occupancy Representation
par: Jiang, Haochen, et autres
Publié: (2024)
par: Jiang, Haochen, et autres
Publié: (2024)
Mem2Ego: Empowering Vision-Language Models with Global-to-Ego Memory for Long-Horizon Embodied Navigation
par: Zhang, Lingfeng, et autres
Publié: (2025)
par: Zhang, Lingfeng, et autres
Publié: (2025)
Case Law Grounding: Using Precedents to Align Decision-Making for Humans and AI
par: Chen, Quan Ze, et autres
Publié: (2023)
par: Chen, Quan Ze, et autres
Publié: (2023)
UNIT: Unifying Image and Text Recognition in One Vision Encoder
par: Zhu, Yi, et autres
Publié: (2024)
par: Zhu, Yi, et autres
Publié: (2024)
Enhanced DSP Architecture for Small Floating‐Point Based Deep Learning Accelerators on FPGAs
par: Kuiming Ma, et autres
Publié: (2026)
par: Kuiming Ma, et autres
Publié: (2026)
The Relationships Between Contingent Reward Leadership, Perceived Organizational Support, Knowledge‐Sharing Intention, Innovative Culture, and Kindergarten Teachers' Creative Teaching Performance: A Mediated Moderation Model
par: Maoyong Huang, et autres
Publié: (2025)
par: Maoyong Huang, et autres
Publié: (2025)
EVLP:Learning Unified Embodied Vision-Language Planner with Reinforced Supervised Fine-Tuning
par: Cai, Xinyan, et autres
Publié: (2025)
par: Cai, Xinyan, et autres
Publié: (2025)
Purely Quadratic Non-Gaussianity from Tachyonic Instability: Primordial Black Holes and Scalar-Induced Gravitational Waves
par: Zhang, He-Xu, et autres
Publié: (2026)
par: Zhang, He-Xu, et autres
Publié: (2026)
DianJin-R1: Evaluating and Enhancing Financial Reasoning in Large Language Models
par: Zhu, Jie, et autres
Publié: (2025)
par: Zhu, Jie, et autres
Publié: (2025)
Document Haystacks: Vision-Language Reasoning Over Piles of 1000+ Documents
par: Chen, Jun, et autres
Publié: (2024)
par: Chen, Jun, et autres
Publié: (2024)
A Multimodal Fusion Framework for Early Non‐Invasive Screening of Cognitive Impairment Using Language Digital Biomarkers
par: Jiahui Xu, et autres
Publié: (2025)
par: Jiahui Xu, et autres
Publié: (2025)
Theoretical Insights into Line Graph Transformation on Graph Learning
par: Yang, Fan, et autres
Publié: (2024)
par: Yang, Fan, et autres
Publié: (2024)
SeePhys: Does Seeing Help Thinking? -- Benchmarking Vision-Based Physics Reasoning
par: Xiang, Kun, et autres
Publié: (2025)
par: Xiang, Kun, et autres
Publié: (2025)
Documents similaires
-
4D-VLA: Spatiotemporal Vision-Language-Action Pretraining with Cross-Scene Calibration
par: Zhang, Jiahui, et autres
Publié: (2025) -
UniUGG: Unified 3D Understanding and Generation via Geometric-Semantic Encoding
par: Xu, Yueming, et autres
Publié: (2025) -
GraphCoT-VLA: A 3D Spatial-Aware Reasoning Vision-Language-Action Model for Robotic Manipulation with Ambiguous Instructions
par: Huang, Helong, et autres
Publié: (2025) -
Whole-Body Inverse Kinematics with Graph Diffusion
par: Huang, Helong, et autres
Publié: (2026) -
RADAR: Revealing Asymmetric Development of Abilities in MLLM Pre-training
par: Nie, Yunshuang, et autres
Publié: (2026)