Genie

Genie

Genie 3是Google DeepMind推出的通用世界模型,能从文本提示生成可实时交互的动态世界。

打开网站

Genie 3世界模型的新前沿

Genie 3是Google DeepMind于2025年8月5日宣布的通用世界模型,能够根据文本提示生成多样化的交互式环境。它继Genie 1和Genie 2之后推出,后两者是DeepMind前一年引入的首批基础世界模型。Genie 3被定位为世界模拟研究的重要一步。

核心能力

根据文本提示,Genie 3可以生成动态世界,用户能够以每秒24帧的速度实时导航,并在720p分辨率下保持几分钟的一致性。它是Google DeepMind首个允许实时交互的世界模型,同时相比Genie 2在一致性和逼真度上有所提升。

Genie 3的演示能力包括:

  • 模拟水的物理特性和光照等世界物理属性;
  • 模拟自然世界,包括动物行为和复杂的植物生命;
  • 建模动画和虚构内容,具有表现力的角色;
  • 探索地点和历史场景。

这些领域展示了模型从类似物理的模拟到富有想象力的反事实场景的广度。

交互与生成机制

除了导航,Genie 3还支持“可提示的世界事件”,这是一种基于文本的交互形式,可以改变生成的世界——例如改变天气条件或引入新物体和角色。环境是基于世界描述和用户操作逐帧自回归生成的。Genie 3的一致性是一种涌现能力,不依赖于NeRF或高斯泼溅等方法使用的显式3D表示;其视觉记忆大约回溯一分钟。

与智能体的集成

Google DeepMind使用其近期版本的SIMA通用智能体(用于3D虚拟环境)测试了Genie 3世界,智能体通过向Genie 3发送导航动作来追求不同目标。由于Genie 3保持一致性,智能体可以执行更长的动作序列并实现更复杂的目标。DeepMind认为世界模型是通往AGI的关键垫脚石,潜在用途包括训练机器人和自主系统以及评估智能体性能。

已知局限

Genie 3的已公布局限包括:

  • 智能体的动作空间受限;
  • 在建模多个独立智能体之间的复杂交互方面仍存在挑战;
  • 无法以完美的地理精度模拟现实世界地点;
  • 文本仅在输入世界描述中提供时才可读;
  • 仅支持几分钟的连续交互,而非数小时。

发布与访问

Genie 3以有限的研究预览形式发布,早期访问提供给一小部分学者和创作者,以收集反馈和跨学科观点。Google DeepMind表示,它与负责任发展与创新团队密切合作,以应对模型开放、实时能力带来的安全和责任挑战。

2026年1月,Google DeepMind和Google Labs推出了Project Genie,这是一个实验性研究原型网络应用,由Genie 3、Nano Banana Pro和Gemini驱动,允许用户通过世界草图、世界探索和世界混音来创建、探索和混音交互世界。访问最初向美国18岁及以上的Google AI Ultra订阅者开放;已知局限包括生成的世界可能不完全逼真、偶尔的控制延迟以及生成限制为60秒。

若有收获,就点个赞吧

相关导航

数据评估

Genie浏览人数已经达到2,如你需要查询该站的相关权重信息,可以点击"5118数据""爱站数据""Chinaz数据"进入;以目前的网站数据参考,建议大家请以爱站数据为准,更多网站价值评估因素如:Genie的访问速度、搜索引擎收录以及索引量、用户体验等;当然要评估一个站的价值,最主要还是需要根据您自身的需求以及需要,一些确切的数据则需要找Genie的站长进行洽谈提供。如该站的IP、PV、跳出率等!

关于Genie特别声明

本站深度导航提供的Genie都来源于网络,不保证外部链接的准确性和完整性,同时,对于该外部链接的指向,不由深度导航实际控制,在2026年8月26日 下午11:50收录时,该网页上的内容,都属于合规合法,后期网页的内容如出现违规,可以直接联系网站管理员进行删除,深度导航不承担任何责任。