一个身价几千亿的人,沉默了四年。不露面,不开会,不接受采访,朋友圈没动静。
2026年9月初,彭博社甩出一篇独家:张一鸣最近天天盯一个项目。
不是豆包,不是抖音,也不是再做一个更火的推荐算法。
是一个"世界模型"。
这不叫视频,这叫"世界"。
我先把话说在前面:这件事,比它听起来要命得多。
张一鸣选这个当"回归第一枪",本身就是个判断——他认定了AI的下一个战场,不在聊天框里。
聊天框那套,他从头到尾没碰。他碰的是"你在哪"。
他当年用推荐算法改变了"你看什么"。这一次,他想改变的是"你在哪"。一个是内容分发,一个是空间本身。不是一个量级的事。
世界模型这条赛道上,名字都很硬。
斯坦福的李飞飞,2024年成立World Labs,第一款产品Marble已经能生成物理上站得住的三维世界。图灵奖得主Yann LeCun,2025年底从Meta出走,2026年3月在巴黎成立AMI Labs,一出手融了10.3亿美元。谷歌更早,Genie 3去年8月就亮相,720p、24帧,今年还接上了街景数据。
字节一个"后来者",凭什么敢进?我帮它把牌数了一遍——
视频模型:Seedance。2026年2月发布的2.0版本,一夕之间把中国的短剧行业洗了一遍,Artificial Analysis含音频Elo榜1219分,全球第一。
云:火山引擎,自己的。
头显:Pico,自己的。
你仔细看这局——谷歌有模型、有云,没有头显;Meta有头显,视频模型很弱;字节是唯一一个三样全齐的。
三样还能转成飞轮:模型生成世界 → 云扛算力 → 头显送进用户眼前 → 内容平台接住流量。
钱也到位了。9月3日,媒体报道字节敲定一笔296亿美元银团贷款,年内亚洲第二大美元银团贷款。同期传出,字节2026年的资本开支可能提到700亿美元,是2025年的两倍多。这不是试探,这是下重注。
概念讲完了。我说点不好听的——这事真正的坎,不在画面。
所有人都在传演示视频有多惊艳。我告诉你,画面从来不是难点。砸钱、砸算力,早晚能出来。真正卡脖子的是三件事。
你在虚拟房间里转个身,再转回来——原来那把椅子,没了。你别笑。这是这类模型现在最大的毛病:遗忘。还不是普通的忘,是"健忘"——东西一出画面就走样。你在里面待五分钟,整个房间开始飘:门换位置,窗户消失,人的脸长得不一样了。世界模型的核心,根本不是"生成",是"记住"。你记不住,它就不是一个世界。
50毫秒,听着很快对吧?但你得问一句:这是模型内部的数字,还是端到端的数字?你把头一动,传感器捕捉 → 传到云端 → 模型生成 → 压缩回传 → 屏幕显示,这一整条链,每一环都要吃时间。带头显的人,画面比脑子慢0.1秒,人是会晕的。我戴过VR眼镜,晕过。一晕,摘下来,这个产品对你就算结束了。VR这些年为什么做不起来?一半原因就是这个字:晕。
一段固定视频,渲染一次,一万个人看、一百万人看,成本早就摊没了——这是互联网最漂亮的生意模型。但"交付一个世界"不是这样。每个用户、每一秒,都得单独算一遍。因为你走的路跟我不一样,你喊的话跟我不一样,没有两个人看到的是同一个画面。100万个人同时在线,就是100万条算力流同时烧着。这已经不是技术问题,这是云账单问题,而且是每秒钟都在烧的那种。
讲到这你可能觉得我太保守。不是。我恰恰认为,字节这条路走得对。
它的打法很清楚:先用娱乐把成本摊下来。
短剧、直播、游戏,这些场景不用对物理世界负责,先把人圈进来。用户基数大,单位成本就降;成本降下来,再往深处扎——机器人、自动驾驶、具身智能,那是另一条路,长得多。
这就是字节一贯的节奏:先做大,再往深里扎。当年短视频,也是这么起来的。
从"看视频"到"活在视频里",这是一次媒介级别的换代。
张一鸣当年用推荐算法改变了世界。这一次他想改变的,是你在哪。
能不能成?我不赌这个演示有多惊艳。我赌一个指标——
人愿意待着,这事就有戏。