Advancing Open-source World Models
Infinite Worlds with Versatile Interactions
A Multi-Modal World Model for Reconstructing, Generating, Simulation
A Systematic Framework for Interactive World Modeling
Research code artifacts for Code World Model (CWM)
Generating Immersive, Explorable, and Interactive 3D Worlds
Inference script for Oasis 500M
Project Lyra: Open Generative 3D World Models
Fast and Universal 3D reconstruction model for versatile tasks
Advanced language and coding AI model
Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence
Robust Speech Recognition Across Languages, Dialects
Agentic, Reasoning, and Coding (ARC) foundation models
MOSS‑TTS Family open‑source speech and sound generation model
A Pragmatic VLA Foundation Model
Generate Any 3D Scene in Seconds
Accurate × Fast × Comprehensive
A Production-ready Reinforcement Learning AI Agent Library
DeepMind model for tracking arbitrary points across videos & robotics
Open-source deep-learning framework
Large Multimodal Models for Video Understanding and Editing
code for Mesh R-CNN, ICCV 2019
Open-weight, large-scale hybrid-attention reasoning model
Towards Real-World Vision-Language Understanding
Chat & pretrained large audio language model proposed by Alibaba Cloud