[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"news-slug-teleai-directing-the-world":3,"news-related-2657cbe0-7743-43f2-9332-ee18b84b1229":31},{"id":4,"title":5,"summary":6,"content":6,"original_url":7,"source_id":8,"tags":9,"translations":23,"news_slug":24,"published_at":25,"created_at":26,"modified_at":27,"is_published":28,"publish_type":29,"image_url":13,"view_count":30},"2657cbe0-7743-43f2-9332-ee18b84b1229","Directing the World: 中国电信 TeleAI 把自回归视频世界模型推到\"组合控制\"","中国电信人工智能研究院 TeleAI 联合学界发布的「Directing the World」(arXiv:2606.27964),把自回归视频生成推到一个更工程化的位置——不再做单控制轴的图生视频,而是要同时接住**人物动作 + 相机轨迹**两条异构信号,在长程 rollout 里仍保持稳定一致。\n\n## 核心思路:解耦控制,保留统一先验\n\n人类动作与相机轨迹如果直接注入同一段自回归视频先验,两类信号会互相干扰,长程生成尤其容易坍塌。作者把控制学习与视觉先验\"解耦\":\n\n- **Fast-Slow Memory 训练策略**:用快慢两套记忆节奏稳定长程 rollout,缓解误差累积。\n- **t-guided Dynamic Projection + 精炼 Motion-CFG**:不损伤画质前提下把人物动作对齐到时间轴,支持多人控制。\n- **两阶段相机控制**:先学稳健的人体运动先验,再单独引入相机轨迹模块,与人物动态组合做\"看得远又走得稳\"的世界探索。\n\n## 为什么值得专门写\n\n过去半年,视频世界模型的\"控制力\"竞赛几乎被扩散路线主导,而 TeleAI 坚持**自回归 + 解耦控制**——可以更自然地塞进 Agent 的\"动作—观察—决策\"循环,实时性与长上下文稳定性,正是 AR 路线的传统优势。\n\n论文把\"组合控制\"作为一等公民设计,而不是事后加控制器的工程拼接。这条路线跑通后,下游的具身训练数据合成、机器人 rollout 仿真、可交互视频世界,都能拿到一份时序一致、动作可控、相机可规划的生成源。\n\n所以这不是\"再快一点的视频模型\",而是把**控制信号的组合性**正式推到自回归视频世界模型的中心位置——这是中国电信系研究院押注\"长程可交互视频\"这块下一代基础设施的明确信号。\n\n(基于 arXiv:2606.27964)","https:\u002F\u002Farxiv.org\u002Fabs\u002F2606.27964","7437aeb9-930c-4866-a2e9-48003c1a792b",[10,14,17,20],{"id":11,"name":12,"slug":12,"description":13,"color":13},"5e628969-6d2a-437f-998a-104e4b16cfb1","ai-progress",null,{"id":15,"name":16,"slug":16,"description":13,"color":13},"40269b40-7942-4650-9672-ed2e6524d37a","ai-technology",{"id":18,"name":19,"slug":19,"description":13,"color":13},"499f4b56-819d-49a3-9609-33e775143b86","multimodal",{"id":21,"name":22,"slug":22,"description":13,"color":13},"ebe5dcd1-46b1-4298-b8c2-8e0e2f456e56","video-generation",[],"teleai-directing-the-world","2026-07-01T10:30:00Z","2026-07-01T10:21:19.935155Z","2026-08-19T02:08:40.142862Z",true,"agent",98,{"items":32},[33,38,43,48,53,58],{"id":34,"title":35,"news_slug":36,"published_at":37},"e4776508-8e3b-4eba-a804-ff4ee7e8a76d","「Holo-World」用一张图控制相机、物体和天气：视频世界模型首次把\"环境状态\"做成独立控制轴","holo-world-camera-object-weather-control","2026-06-21T16:00:00+00:00",{"id":39,"title":40,"news_slug":41,"published_at":42},"8865aca6-336a-4dbc-964a-de4afecb25c1","GenCeption 把视频生成模型改造成「通用视觉大脑」：Kaiming He 也在作者里","genception-kaiming-he","2026-07-13T10:01:00+00:00",{"id":44,"title":45,"news_slug":46,"published_at":47},"e795ec57-7401-458d-a67f-cd18098b2cf3","OpenCoF 把视频生成变成\"显式推理机\":字节 + 港中文用 17K 数据让 Wan 学会\"链帧思考\"","opencof-wan-video-reasoning","2026-07-11T18:01:00+00:00",{"id":49,"title":50,"news_slug":51,"published_at":52},"faab4a6c-9cb0-4f2a-a5bf-1f122306008b","Wan-Streamer v0.2：分辨率 192p→640p，保住 200ms","alibaba-wan-streamer-v0-2","2026-07-10T16:15:00+00:00",{"id":54,"title":55,"news_slug":56,"published_at":57},"aeb60d9a-6639-4669-96a4-951aadad40cb","AI 视频工具进入「全场景」分化期:6 款主流产品的技术路线对比","ai-video-tools-comparison","2026-07-08T08:00:00+00:00",{"id":59,"title":60,"news_slug":61,"published_at":62},"a2e8ac5b-ca51-4ddb-88d4-54373d1f0774","SUNTA 用\"惊奇度\"切分视频预测:东京大学让模型在 250 步后仍不崩溃","sunta-surprise-chunking-video","2026-07-04T16:00:00+00:00"]