信也科技杯 “需要大智慧的AI,而不是大算力的AI”

2026-08-14 09:22:05
来源:经理人
分享
AIME

问财摘要

1、第十一届信也科技杯全球AI算法大赛聚焦“对话轮次交互建模”,旨在提升AI在人机对话中的“社交直觉”。信也科技首席科学家王春平和同济大学教授王昊奋表示,AI交互能力是行业还没有认真打磨的一个方向。 2、今年参赛选手的背景比往届更多元,这背后是AI和智能体正在让创新的门槛变低。 3、提升对话轮次建模的能力,有助于信也科技提升AI语音交互体验,使人机沟通更加顺畅丝滑。
免责声明 内容由AI生成
文章提及标的
信也科技--
智能音箱--
大智慧--
能源--
查看股票机会下载客户端

近期第十一届信也科技(FINV)杯全球AI算法大赛圆满落幕。本届大赛赛题聚焦“对话轮次交互建模”,旨在提升AI在人机对话中的“社交直觉”——即像人一样预判对话节奏,准确判断何时回应、何时沉默。参赛选手需要基于5到30秒的真实方言电话对话音频,预测紧随其后2秒内是否会发生继续、轮换、短回应、打断、沉默这五类对话动作。

信也科技(FINV)首席科学家王春平表示,早期,AI追求的是理解用户在说什么,再往后是生成的语音是否像人,而现在期待交互的过程本身也要像真人一样生动。

信也科技首席科学家王春平

同济大学教授、中国计算机学会(CCF)杰出会员、中国计算机学会自然语言处理专业委员会秘书长王昊奋是决赛评委之一。他表示,让AI知道怎么“接话”,是一个非常普遍的需求。“回想早期的智能音箱(885771)、客服机器人会让人觉得‘傻傻的’。但如果能做到全双工、随时可以被打断、在各种方言和噪声环境下依然能实时判断,这件事对客服、数字人、直播、各类带情感的虚拟陪伴场景,都会产生撬动和应用价值。”

同济大学王昊奋教授,本届科技杯评委之一

然而,AI的交互能力是行业还没有认真打磨的一个方向。王昊奋认为,OpenAI推出GPT-4o之后,大模型的发展分化为两条路:一条是推理,强化数学、编程能力,例如GLM5.2、Kimi K3、DeepSeek V4Pro等;另一条是GPT-4o、Sora、Seedance这类模型所代表的方向,指向的是更广泛的“世界模型”——要真正理解世界的运行规律,模型就必须具备全模态的感知能力,也必须能像人一样实时地作出反应。

信也科技(FINV)算法科学家倪博溢认为,尽管目前市面主流大模型语音交互已实现基础交互能力,但训练成本巨大。目前为了节省训练成本,主流的做法会选择搭建一整套工程流程:先把语音转成文本,交给语言大模型判断该回复什么,生成文本后再转回语音。这条链路里,专门负责“接话时机”的是一个独立的轮次判断模块——它从最早只能判断是否有声音,到后来能识别是否是人声,进化到现在能结合语义、判断对方是否快要讲完的轮次检测。

信也科技算法科学家倪博溢

今年这道赛题,就是把“轮次建模”从一个庞大的模型里拆解出来。王昊奋将这道题的设计逻辑总结为“以小博大”:成本小、算力小、切口小。他说:“我们需要的是有大智慧(601519)的AI,不是有大算力的AI。”因此,赛题也给选手设下了一道硬性门槛:模型参数量不能超过8B。最终,选手交出的方案大多落在1.2B到1.4B之间,在较低算力条件下即可运行。

王昊奋期待,未来的AI应该是能力强、可控,同时算力友好、数据友好乃至能源(850101)友好的智能,这和“技术向善”、为全人类福祉服务的方向是一致的。

倪博溢也观察到,今年参赛选手的背景比往届更多元,不少选手并非算法科班出身,也有不少是没有组队、独自参赛的个人选手,“这背后是AI和智能体正在让创新的门槛变低。”

提升对话轮次建模的能力,有助于信也科技(FINV)提升AI语音交互体验,使人机沟通更加顺畅丝滑。但王春平认为,它的适用范围不止于此,任何涉及对话和交互的场景,比如情感陪伴、机器人互动,都有助于建立信任感,从而提升用户体验。

免责声明:风险提示:本文内容仅供参考,不代表同花顺观点。同花顺各类信息服务基于人工智能算法,如有出入请以证监会指定上市公司信息披露平台为准。如有投资者据此操作,风险自担,同花顺对此不承担任何责任。
homeBack返回首页
不良信息举报与个人信息保护咨询专线:10100571违法和不良信息涉企侵权举报涉算法推荐举报专区涉青少年不良信息举报专区

浙江同花顺互联信息技术有限公司版权所有

网站备案号:浙ICP备18032105号
证券投资咨询服务提供:浙江同花顺云软件有限公司 (中国证监会核发证书编号:ZX0050)
AIME