商汤大模型的「5o」交互,普通人如何和 AI 过一天?

时间:2025-06-04 关注公众号 来源:网络

在未来的世界里,随着日日新5o的诞生,人工智能不再只是冷冰冰的科技概念,而是化身为一位无所不能的贴身助手,彻底改变了人类的日常生活。这是一段关于科技与人性交织的奇幻旅程。主人公艾莉森,一位对世界充满好奇的探险者,与她的智慧伙伴日日新5o携手,展开了一场前所未有的日常冒险

清晨,当第一缕阳光透过窗户,日日新5o已为艾莉森规划好一天的行程,从天气预报时尚搭配,无微不至。在一次偶然的旅行中,面对着壮丽的风景,它不仅捕捉到了最美瞬间的摄影技巧,还让艾莉森的每一张照片都成为了艺术的见证。夜晚,围绕篝火的烧烤聚会,日日新5o不仅指导着美食的烹饪,更以其精准的味觉与视觉感知,让每一次烧烤都成为味蕾的盛宴。

这不仅仅是一部关于科技的故事,它是关于一位虚拟助手如何融入人类生活,以其无限的知识与细腻的情感,为平凡的日子增添无限可能。在日日新5o的陪伴下,每个挑战都变成了探索的乐趣,每一次询问都得到了超越期待的回答。在这个未来世界里,人工智能不再是工具,而是生活中不可或缺的伙伴,共同编织着充满惊喜与温暖的现代童话。

  

在商汤的演示下,日日新5o拥有像人一样的实时视觉能力,可以跟人进行流畅的视频交互——能听、能说、能看、无延时,它可以通过摄像头+语音实现和用户的实时交互,并获知用户所在的真实场景下的各种状态信息,打破了与AI交互的次元壁,实现了与AI的“视频通话”,已经具备真人聊天般的交互体验。   

  

两个月前OpenAI推出了GPT-4o,以突破性的智能交互能力,彻底颠覆了我们对AI语音助手的认知,颠覆了过去的人机交互,给业界带来又一次震撼。   

  

带来的共识是,多模态可能引领新的交互模式和产品创新,多模态大模型开始成为国内大模型竞争的下一个焦点。   

  1大模型可以是每个人的贴身AI全能助手   

如果你拥有一个能看(现实世界)、能听(读懂指令)、能说(回答问题)的贴身AI助手,将会是一种什么体验?   

  

这位贴身助手,拥有丰富的多领域知识,包括生活、学习、工作各方面的知识,关键还能看懂现实世界——摄像头就是它获取现实世界影像的眼睛,而视觉触及到的信息,它能立马进行分析、总结,通过实时对话,像面对面聊天一样,立即告诉你问题的答案,没有延迟和拒绝。   

  

早上起来,准备出门,你想知道现在外面的天气应该做哪些准备,日日新5o可以准确地描述出外面的天气状况,并给出外出准备的建议:   

  

走到一处很美的地方,你想拍照,但是不知道用什么姿势拍出来好看,日日新5o开始充当一个摄影助手,它会指导你如何根据当前景色摆姿势动作、注意光线等等技巧:   

  

晚饭是一顿烧烤,大家一起搭起炭火炉、燃起炭火准备烧烤,日日新5o能准确地知道视频里的人们正在干嘛,而且还能告诉详细的户外烧烤注意事项:   

  

你想知道每种食材分别要如何烧烤才好吃,此时日日新5o化身为一名拥有多年烹饪经验的烧烤大师,它能分辨出每种食材、要如何烤:   

  

回到酒店,你看到一袋咖啡,询问日日新5o后它能识别出这是咖啡粉而不是速溶咖啡,并告诉你咖啡粉对应的冲泡步骤,宛如一个咖啡师:   

  

日日新5o不仅拥有大量、多领域的生活方面的知识,在日常生活场景中分别充当了发型助手、摄影师、烧烤大师、咖啡师……在职场工作环境中,也是一把好手,比如能迅速地总结出这本书该页讲了什么知识。比人的反应、分析、总结速度快多了:   

  

面对一张手写的字条或诗句,它也能立马回答出它的意思和出处:   

  

还能根据前三个字,准确预测出整个成语是什么:   

  

从以上可以看到,日日新5o具备非常丰富的多领域知识,相比其他AI助手,它能看、能听、能读,首创的实时流式交互方式,使其具备真人般的交流对话;能精准地分析、辨别、总结出所「看到」的环境信息,在我们的生活、学习、工作中可以扮演多种助手角色,完全可以充当一款AI全能助手。   

  2重塑交互的意义   

日日新5o能作为一款表现出色的AI全能助手,除了展示出了它对标GPT-4o的各种能力:能看到那个现实世界,包括人、物、文字等符号;能听懂用户的话语,并根据其中的指令对现实世界进行识别,再反馈给用户;能看书识字,概括总结所讲的内容……   

  

最大的变革就是交互模式的变化:国内首个流式交互多模态大模型。商汤将流式交互融入到大模型中,给用户带来真人般的交流体验,让日日新5o系统更像人。   

  

我们知道,在人工智能发展中,ChatGPT之所一炮而红,便是因为它开始展露出人类所具备的自主学习、分析、总结能力以及逻辑能力,而让大模型像人一样交流,正如引言所说,交互模式先行似乎并不是业界共识。   

  

而商汤的日日新5o的发布,正是符合商汤对AI2.0时代的判断,正如CEO徐立所说:行业要变化,交互模式一定是先行的。   

  

在徐立看来,变化是指能定义AI2.0时代的「超级时刻」,正如iPhone时刻定义了移动互联网的变化。而超级时刻需要一个超级应用,即便是像ChatGPT、Sora都还没有到超级时刻,是因为它们没有真正走进到一个行业的垂直应用中、引起广泛变化。   

  

走向应用,商汤认为需要有几个核心的重点突破:   

  

第一个就是实时的交互性能带来流畅的用户体验,这是推动超级时刻以及应用爆发的一个核心。   

  

第二是构建高阶思维逻辑的合成数据,来提升模型的智力。   

  

最后,不管是文本、图像、视频,如果对它没有可控性,那么它们作为一个工具,本身带来的效能提升就非常有限。   

  

商汤最新发布的日日新5.5基座模型,便用了大量的合成、高阶思维链的数据,把模型能力平均提升了30%。   

  

商汤大模型的「5o」交互,普通人如何和 AI 过一天?   

  

商汤CEO徐立认为,如果要推动人工智能超级时刻的到来,需要大模型可以展现出卓越的深度思考的能力。那么合成的人工数据,特别是高阶思维的数据往往是非常重要的。所以越是有应用的场景,才能形成更好的高质量的数据的一些核心。   

  

过去垂直领域是依赖人去构建更加高级的思维链数据,但是商汤认为,往前一步,不应该依赖人,而是应该通过跟真实世界的交互形成执行数据,去做推理。   

  

因此,基于基座模型日日新5.5,商汤研发了日日新5o流式交互多模态大模型,在摄像头不停地移动过程中、跟真实世界互动获取更多新的信息,去进行推理、再得出反馈。   

  

日日新5o的各种功能离不开基座模型日日新5.5的支撑。今年4月发布的日日新5.0是国内首个对标GPT-4Turbo的大模型,经过两个多月技术迭代,日日新5.5实现了多项功能升级,在数学推理、英文能力、指令跟随等能力上明显增强,交互效果和多项核心指标可比肩GPT-4o。   

  

徐立认为,如果能把这种流式交互多模态大模型置入眼镜、手机、电脑等端侧设备,可能会推动一些应用的爆发。   

  

商汤大模型的「5o」交互,普通人如何和 AI 过一天?   

  

以上就是商汤大模型的「5o」交互,普通人如何和AI过一天?的详细内容,更多请关注其它相关文章!   

阅读全文
扫码关注“ 多特资源库
更多更全的软件资源下载
文章内容来源于网络,不代表本站立场,若侵犯到您的权益,可联系我们删除。(本站为非盈利性质网站)
玩家热搜

相关攻略

正在加载中
版权
版权说明

文章内容来源于网络,不代表本站立场,若侵犯到您的权益,可联系我们删除。(本站为非盈利性质网站)

电话:13918309914

QQ:1967830372

邮箱:[email protected]

toast