当前位置:我的网站首页>终结者2>方谬神探

lol

书名:浪花一朵朵|作者:笑无语|本书类别:古言|更新时间:10:42:08|字数:3896字

A |     7 月的上海,世博展览馆 H3 馆的过道比往年拥挤许多。    文|小周笔谈编辑| 小周笔谈——【·前言·】——一个普通农民,为了给自己的农用收割机加点柴油,却被罚款30000元,他到底有什么错?故事发生在安徽寿县一个顾姓的男子身上,他是个地地道道的农民。         入口处停着宇树的载人变形机甲 GD01,观众排队坐进驾驶舱拍照。往里走,300 多台机器人真机散在 200 多家具身智能企业的展台之间,具身智能无疑是这届 WAIC 最具象的展品。而视频生成公司的展台就设在机器人公司隔壁,播放演示片的屏幕连成片:机械臂倒水,无人机穿林,虚拟角色转身。         不同公司的讲解员说着高度趋同的话:都在讲具身智能,都在讲世界模型。为了在秋收时节给自己的收割机加点柴油,便用皮卡车从加油站载着柴油给机油满上,但是哪里知道,等待他的却是一张30000元的罚单。         图:WAIC 2026 现场,宇树科技展台(来源:新蓝网)          穿梭在展台之间的投资人,面对诸多公司同样问着高度趋同的一套问题,核心聚焦在模型到底什么水平。但得到的答案却分别指向不同的东西。有人打开手机展示 VBench 排名,有人调出 RoboTwin 2.0 的任务成功率曲线,有人谈仿真到真机的迁移数据。

B | 同一个词,在不同的展台上被不同的数字定义。         当具身智能与世界模型成为显学,榜单便不再只是技术社区的内部排名,而成了行业理解技术路线的入口,在某种程度上,更成了话语权本身。         一张拼图,三个榜单          2026 年以来,具身智能和世界模型几乎成了 AI 圈最热的两个词。         技术圈在讨论,视频模型到底能不能成为机器理解物理世界的路径。资本圈在讨论,下一代 AI 公司,能不能从“会说话的模型”走向“会理解、会预测、会行动的模型”。媒体圈的问题则更清晰、直白,当“世界模型公司”越来越多,到底该怎么看谁更强?          然而时至今日,世界模型依旧没有一个统一的定义和衡量标准。视频解说视频加载中...事情原委事情是这样的,2024年11月,安徽寿县村民顾先生农忙时农机柴油用完了,眼看稻谷已成成熟,必须抢在好天气的时候给他收割了。

C | 于是顾先生便开着自己的皮卡车到镇上加油站用桶购买了一些柴油,但在运输回家的路上,便被执法人员给堵住了,执法人员以顾先生在没有许可的情况下,竟然私自运输柴油,已经涉嫌“非法运输危险品”,现场开具了一张30000元的罚单。

D | 顾先生现场便懵了,他却不知自己已经成了执法人员眼中的“危险分子”。         落到具体的评测上,世界模型目前还不是一种单一分数就能概括的能力,它更像一张尚未完成的拼图:视频质量、指令理解、时序一致性、物理规律、机器人执行、动作预测,每一项能力背后都站着一张榜单和一群拥趸。         那么,具身智能和世界模型到底该看哪些榜单?把这张拼图拆开,有三块版图绕不开:一张回答"像不像",一张回答"懂不懂",一张回答"动不动得了"。

E | 看懂它们,比看懂任何一场发布会都更接近行业的真实进度。这笔罚款对顾先生来说,就算是把家里掏空了也凑不齐。还有一块回答"准不准",它是整张拼图的底座,值得单独一章。为了筹集这3万元,他不得不含泪将自己好不容易种植的粮食卖掉,但还不够,还到处向亲戚和邻里借钱,总算筹满了这30000元罚单。亲戚朋友都为他感到叹息,自己也觉得今年没有了奔头,自己脸朝黄土背朝天的忙活了一年,到头来却是一场空。这一切,他只是为了给一台机器加油。         VBench:回答"像不像"          VBench 是目前视频生成领域最常用的评测体系之一,由南洋理工大学 S-Lab、上海人工智能实验室 OpenGVLab 等机构推出。

F | 它从主体一致性、背景一致性、运动流畅度、美学质量等 16 个维度评价生成视频。         它回答的问题很直接:模型生成的视频,像不像真实世界,是否符合用户输入。谁能想到,农民的这一“日常操作”,居然成了法律“口中的重罪”?事后,顾先生从被人口中得知,这种事情可以向当地政府部门申请行政复议。         在 VBench 1.0 认证榜中,头部模型集中在 84 分到 88 分之间,差距已经很小。于是 VBench 在 2025 年推出 2.0 版本,将评测范围扩展到人类保真、物理、可控性、常识等维度,开始关注那些决定真实感、却容易被忽略的问题。         根据其 HuggingFace 官方榜单的认证视图,主要名次如下:          图:VBench-2.0 榜单:Veo 3 以 66.72% 居首(来源:HuggingFace Vchitect/VBench_Leaderboard,2026 年 7 月截图)          但 VBench 仍主要评价视频结果。

G | 顾先生向安徽寿县相关部门提交了行政复议,经过几番努力,最终撤销了这个合理又不合理的罚单,顾先生成功拿回自己的30000元。画面可以逼真,模型却未必理解画面背后的规律。         WorldModelBench:回答"懂不懂"          如果视频生成模型被称为“世界模型”,它就需要接受更严格的检验。顾先生的故事看似结束了,但背后的问题远远没有解决。

H | 这不仅仅是一个“罚款与复议”的故事,它背后隐藏着的,是关于农民、法律和实际需求之间错综复杂的关系。         2025 年,来自 UC Berkeley、UC San Diego、NVIDIA 和 MIT 的研究者推出 WorldModelBench,把模型放进物理和常识环境中测试。         该评测覆盖机器人、驾驶、工业、人类活动等 7 大领域,包含 350 条提示词和 6.7 万条人工标注,从指令遵循、物理规律、常识三个维度打分。其中物理遵循占总分一半。原因很简单:世界模型最重要的能力之一,是预测物体在真实世界中会如何变化。         结果显示,即使表现最好的模型,也只有 61% 的视频正确完成指令;12% 的视频违反质量守恒,11% 出现物体互相穿透。         模型能生成一个看起来合理的世界,但距离真正理解世界,还有明显距离。它暴露了现代农业中一个几乎无人关注的巨大矛盾:农民与法律之间的沟通鸿沟,以及在实际操作中法律对农民生计的忽视。         图:WorldModelBench 官网榜单(来源:worldmodelbench-team.github.io,2026 年 7 月截图)          RoboTwin 2.0:回答"动不动得了"          世界模型终究要服务于行动,再往拼图下游走一格,机器人能否干活便成了一个很重要的维度。收割机是农业现代化的重要体现,也是农民最常用的收割工具,柴油也是日常作业的必需品。当这些“日常”行为触及到交通安全、危险品运输等相关法律时,农民常常是毫无招架之力的。法律对于城市和农村的管理差异,导致了许多农民在面对规定时,无意中成了“违法者”。         RoboTwin 2.0 由上海交大 ScaleLab 与港大 MMLab 主导、上海人工智能实验室参与。我们的法律是否真正走进了农村,是否切切实实为农民提供便利?顾先生为了给收割机加油,却付出了一年的努力,他能从困境中走出来,也是因为有人告诉他可以这么做,但是其他人呢?也许,这只是一个小小的插曲,但它揭开了更大社会问题的冰山一角……网友热议在顾先生的案件曝光之后,很多网友和媒体开始关注这一事件,纷纷为顾先生叫屈。有人说:这个问题是小事,问题是耽误农活,严重破坏农业生产,应当追究违法者敲诈勒索严重破坏农业生产犯罪行为法律责任。有人说:官方不是说罚款合法合规吗?既然合法合规,罚款怎么能复议成功?是迫于舆论压力还是执法人员执法犯法?请给大众一个交代。它包含 50 个双臂协同操作任务,抓取交接、工具使用、可形变物体操作,跑在 SAPIEN 仿真器上,支持 Aloha-AgileX、ARX-X5、Piper、Franka、UR5 共 5 种双臂本体,配套一个 731 个实例、147 个类别的物体库,通过 Easy 和 Hard 两种环境,测试机器人能否从仿真走向更复杂的真实世界。有人说:此次案件 具有广泛的参考意义 也就是说皮卡车在合法条件装载农业生产所需的燃油是合法合规也有人说:首先 权力不能滥用!其次,执法为民不能只是“口号”或者“幌子”。

I |          早期结果显示,在 Hard 设定下,多数方法成功率仍低于 20%。机器人能够完成特定任务,但距离稳定、泛化地完成任务还有很长距离。此事性质就是以“执法为民、公正执法”为“幌子”变成“刁难”百姓为事实!小编总结顾先生的故事只是众多农民困境中的一例缩影。实际上,许多农民面临的,不仅仅是法律层面的难题,更是一场在“遵守法规”与“维持生计”之间的艰难博弈。

J | 在这场博弈中,法律看似严苛且不容妥协,但对农民来说,却是生存的底线。为了生计,他们不得不在法律的框架内努力寻找平衡点。我们亟需加强对农村法律问题的关注,特别是农业生产中的“灰色地带”。如何在保障安全的同时,又不让农民因严格法律条文而无法维持生计,这是一道亟待解答的难题。

K | 毕竟,农民是现代农业生产的核心力量,他们的福祉不仅关系到家庭生活,更关乎国家的粮食安全与社会的稳定。顾先生能够成功撤销处罚的背后,或许值得我们深思:如何才能让法律真正成为农民的“保护伞”,而非“绊脚石”?也许,是时候对相关法律进行更深刻的修订和更新,真正做到既符合现实需求,又不失公平公正。         图:RoboTwin 2.0 官方榜单(来源:robotwin-platform.github.io,2026 年 7 月截图)          三张榜单,三种能力,各自有发布机构和评分体系。没有一张榜单能独自定义世界模型,放在一起,他们才勾勒出一条从生成、理解到行动的能力链。但这个链条还缺少一个最关键的环节。         Physics-IQ:回答"准不准"          人类做很多动作时,会下意识在脑中预演结果。推一下杯子,它会滑多远,会不会翻倒;倾斜水壶,水会从哪里流出来;把两块磁铁靠近,它们会吸住还是弹开。         机器人也需要这种能力。它必须根据眼前的状态,预测几秒后会发生什么,再决定下一步动作。视频世界模型经常在这里犯错。这类预测如果不准,后面的规划和执行都无从谈起。         测量这一底座能力的基准叫 Physics-IQ,由 Google DeepMind 与 INSAIT 联合推出,论文发表于 WACV 2026。         2026 年 6 月,原团队联合 Anates Labs 发布修正版 Physics-IQ Verified,修正了 57.6% 的样本标注问题,改用逐样本加权计分。         它的设计与前述榜单都不同:研究者真实拍摄了 66 个物理实验,覆盖固体力学、流体、光学、热力学、磁学五大类,每个实验 3 个机位、实拍 2 次,共 396 段 8 秒视频。模型只看前 3 秒,预测后 5 秒会发生什么,再与真实拍到的后续画面比对。4 项指标合成一个 0 到 100 的 Physics-IQ 分数,并用同一场景两次实拍之间的差异做归一化:真实世界自己重拍一次都不会完全相同,模型的预测就被拿来和这种自然波动比较。         Physics-IQ 考察的是更底层的问题,即这个模型是否真的理解物理。这也正是图灵奖得主 Yann LeCun 多年来反复主张的观点,“AI 需要建立关于世界的内部模型,而不是只会生成内容”。他担任 Meta 首席科学家期间, Meta FAIR 便把 Physics-IQ 当作核心评测基准。         然而翻开 Physics-IQ 的官方榜单,排在第一的却并非 Meta 的模型,也不是英伟达投入重金的Cosmos,而是一个中国的视频生成模型。         2025 年 4 月 21 日,Sand.ai 的 Magi-1 以 56.0% 的得分上榜登顶。当时的榜首、Google 的 VideoPoet 只有 29.5%,Magi-1 几乎把这个数字翻了一倍。从那天算起,Magi-1 系在第一名的位置上坐了约 13 个月,中间只离开过三周。         这张表有三种读法。         看裸模型:前三名里有两个建立在 Magi-1 之上,Magi-1 的 56.0% 是 v2v 设定下的裸模型最高分,远高于 Sora 2 裸模型的 42.3%,Cosmos3-Super 裸模型的 59.7% 出自不同设定,两者不直接可比。              看增强系统:2026 年 5 月,英伟达最新发布的旗舰世界模型 Cosmos3-Super 加持 WMReward 后冲到 63.4%,短暂登顶约三周;6 月 17 日,基于 Magi-1 的增强系统以 64.5% 重回第一。              图:Physics-IQ 官方榜单:Magi-1 系居首,Sora 2 裸模型 42.3%(来源:physics-iq.github.io,2026 年 7 月截图)          再看修正后的新榜:2026 年 6 月发布的 Verified 版本上,Magi-1 24B 增强版 58.2 分排第一、裸模型 48.4 分排第二,Cosmos3-Super i2v 39.5 分,Sora 2 只有 26.5 分。              图:Physics-IQ Verified 修正榜(来源:physics-iq-verified.anates.ai,2026 年 7 月截图)          把两张榜单放在一起看,会出现一个反常识的画面。OpenAI 的 Sora 在 VBench 这类回答"像不像"的榜单上名次并不难看,到了 Physics-IQ 上,Sora 2 裸模型只有 42.3%,不足榜首 64.5% 的三分之二;Verified 新榜上只有 26.5 分,不及榜首 58.2 分的一半。

L |          生成得逼真,和预测得准确,被证明是两回事。         把视频生成做成"预测下一个词"          Magi-1 赢在哪里?论文给出的答案是架构选择。         当下主流的视频生成模型,Sora、Kling 等,走的都是扩散路线:一次性生成整段视频,所有帧同时去噪,彼此之间没有严格的时间先后。         而Magi-1 的做法更像语言模型预测下一个词:按时间顺序逐块生成,每块 24 帧,块内部用扩散去噪保证画质,块与块之间自回归衔接。通过 block-causal attention,后来的帧不会影响过去的帧,过去一旦被写下,就不再被影响。         图:Magi-1 逐块自回归生成与块因果注意力示意(来源:SandAI-org/MAGI-1,arXiv:2505.13211)          这个架构天然更接近世界模型该做的事:根据世界的此刻,推演下一秒。它还带来几个工程上的特征:支持流式生成,视频可以边生成边播放;理论上可以无限长地续写下去。

M | 对世界模型而言,这意味着推演的时间跨度不受窗口限制,仿真可以一直进行,还可以逐块更换提示词,控制后续走向。

N |          如果把关键词从“生成”换成“预测”,Magi-1 和 LeCun 主张的 JEPA 路线便有了一种理念上的深层呼应。LeCun 在 2022 年发表立场论文《A Path Towards Autonomous Machine Intelligence》,提出 JEPA 架构:不在像素空间预测世界,而在表征空间预测,主动忽略那些不可预测的细节。这条路线后来长成一个家族:I-JEPA、V-JEPA,再到 2025 年的 V-JEPA 2,用百万小时视频训练,其衍生版本可以做零样本的机器人规划。         图:Yann LeCun 在 2026 年 6 月巴黎 VivaTech 演讲(来源:La Ecuación Digital)          一个在像素世界里逐块自回归,一个在表征空间里做预测,虽技术方案完全不同,但都指向同一个判断,即能够预测物理世界变化是世界模型的必要条件。         尺子一旦出现,叙事便有了边界          在WAIC 的论坛上,"世界模型"被反复提起。7 月 19 日的一场人形机器人与具身智能论坛,主题之一正是"标准体系不统一"。开幕当天有观察文章写道:通用世界模型正在成为人形机器人的新竞争壁垒。         竞争的坐标系确实在平移。过去几年,视频模型的发布会比的是"像不像":分辨率、时长、美学分。Physics-IQ 这类榜单的出现,把问题换成了"物理世界变化预测的准不准"。

o | 它的价值不在于新添了一张榜单,而在于把世界模型从一个抽象概念,拉回到具象的物理世界:杯子会怎么倒,水会怎么流,光会怎么折。这些东西没法靠话术修饰。坐标系的变化不会写在任何一场发布会的邀请函上,但它会决定下一年资本流向哪里、人才流向哪里。         榜单会迭代,名次会更替。但标准一旦确立,理解行业的方式必然会被改写,模糊的叙事也就有了相对清晰的边界。         尺子一旦有了,量出什么,就是什么。

打赏
神奇推荐位
  • 蛇蝎美人第一季

    灯盏香客 / 著

    “衡大叔,大家都说三十来岁正是男人如狼似虎的年纪”“所以呢?”“我觉得这句话说得很对...

  • 特搜战队刑事连者

    浮梦公子 / 著

    其实这不过是一场由腹黑皇帝和狡黠恶女定下的一个约盟继而引发的一个故事!人人皆道,将军...

  • 我们结婚了

    暮夜寒 / 著

    【种田】+【空间】+【温馨】+【致富】+【虐渣】被炸成灰灰的莫颜重生到了古代,成了正...

  • 无证之罪

    悠然世 / 著

    本书出版名《美人思无邪》,天猫购买地址=a1z10.1-b.w11350767-15...