【CNMO科技动静】近日,英伟达于台北举办的GTC勾当上宣布了Cosmos 3,并将其称为全世界首个“彻底开放的万能模子”。该模子面向呆板人、主动驾驶汽车和视觉智能体,主打基在视觉的推理能力,同时可天生文本、图象、视频、情况声音及动作等多模态内容。 据先容,Cosmos 3采用由推理Transformer与天生Transformer构成的架构。前者用在理解物体交互、运动以和时空瓜葛,后者则于此基础上天生视频内容及动作轨迹。英伟达暗示,这类设计使模子可以或许先理解实际世界中的物理互动,再输出与之对于应的画面及举动成果,从而晋升对于繁杂情况的建模能力。 英伟达称,Cosmos 3重要针对于呆板人、主动驾驶车辆及视觉代办署理于真实情况理解上的难题。当前相干练习数据仍旧有限,仿真体系也较为分离,这使患上呆板于进修物理世界纪律时面对较高门坎。Cosmos 3的方针是让模子以更高的物理正确性,原心理解并天生文本、图象、视频、情况声音和动作信息。 从运用定位来看,英伟达暗示,Cosmos 3既可作为视觉语言模子利用,也可作为模仿物理情况、猜测将来世界状况的世界模子,还有可作为其他世界模子的基础平台。产物计划方面,相应精度最高的Cosmos 3 Super及轻量版本Cosmos 3 Nano已经可用,面向边沿装备及时推理的Cosmos 3 Edge将在后续推出。 于技能层面,Transformer是一类深度进修神经收集,擅优点理序列数据中的上下文瓜葛,可经由过程并行计较晋升天生效率。英伟达这次将推理与天生能力联合,意于为呆板人及主动驾驶体系提供更靠近真什物理世界的基础模子能力。 版权所有,未经许可不患上转载