近期第十一届信也科技(FINV)杯全球AI算法大赛圆满落幕。本届大赛赛题聚焦“对话轮次交互建模”,旨在提升AI在人机对话中的“社交直觉”——即像人一样预判对话节奏,准确判断何时回应、何时沉默。参赛选手需要基于5到30秒的真实方言电话对话音频,预测紧随其后2秒内是否会发生继续、轮换、短回应、打断、沉默这五类对话动作。
信也科技(FINV)首席科学家王春平表示,早期,AI追求的是理解用户在说什么,再往后是生成的语音是否像人,而现在期待交互的过程本身也要像真人一样生动。
信也科技首席科学家王春平
同济大学教授、中国计算机学会(CCF)杰出会员、中国计算机学会自然语言处理专业委员会秘书长王昊奋是决赛评委之一。他表示,让AI知道怎么“接话”,是一个非常普遍的需求。“回想早期的智能音箱(885771)、客服机器人会让人觉得‘傻傻的’。但如果能做到全双工、随时可以被打断、在各种方言和噪声环境下依然能实时判断,这件事对客服、数字人、直播、各类带情感的虚拟陪伴场景,都会产生撬动和应用价值。”
同济大学王昊奋教授,本届科技杯评委之一
然而,AI的交互能力是行业还没有认真打磨的一个方向。王昊奋认为,OpenAI推出GPT-4o之后,大模型的发展分化为两条路:一条是推理,强化数学、编程能力,例如GLM5.2、Kimi K3、DeepSeek V4Pro等;另一条是GPT-4o、Sora、Seedance这类模型所代表的方向,指向的是更广泛的“世界模型”——要真正理解世界的运行规律,模型就必须具备全模态的感知能力,也必须能像人一样实时地作出反应。
信也科技(FINV)算法科学家倪博溢认为,尽管目前市面主流大模型语音交互已实现基础交互能力,但训练成本巨大。目前为了节省训练成本,主流的做法会选择搭建一整套工程流程:先把语音转成文本,交给语言大模型判断该回复什么,生成文本后再转回语音。这条链路里,专门负责“接话时机”的是一个独立的轮次判断模块——它从最早只能判断是否有声音,到后来能识别是否是人声,进化到现在能结合语义、判断对方是否快要讲完的轮次检测。
信也科技算法科学家倪博溢
今年这道赛题,就是把“轮次建模”从一个庞大的模型里拆解出来。王昊奋将这道题的设计逻辑总结为“以小博大”:成本小、算力小、切口小。他说:“我们需要的是有大智慧(601519)的AI,不是有大算力的AI。”因此,赛题也给选手设下了一道硬性门槛:模型参数量不能超过8B。最终,选手交出的方案大多落在1.2B到1.4B之间,在较低算力条件下即可运行。
王昊奋期待,未来的AI应该是能力强、可控,同时算力友好、数据友好乃至能源(850101)友好的智能,这和“技术向善”、为全人类福祉服务的方向是一致的。
倪博溢也观察到,今年参赛选手的背景比往届更多元,不少选手并非算法科班出身,也有不少是没有组队、独自参赛的个人选手,“这背后是AI和智能体正在让创新的门槛变低。”
提升对话轮次建模的能力,有助于信也科技(FINV)提升AI语音交互体验,使人机沟通更加顺畅丝滑。但王春平认为,它的适用范围不止于此,任何涉及对话和交互的场景,比如情感陪伴、机器人互动,都有助于建立信任感,从而提升用户体验。
