News & features
SlideSparse:拓展结构化稀疏边界
结构化稀疏被认为是提升大模型推理效率的重要方向之一。为了支持这类计算模式,如今的GPU 中引入了稀疏张量核(Sparse Tensor Core),能够为 2:4 结构化稀疏提供最高 2 倍的矩阵运算吞吐。其中,2:4 稀疏要求每 4 个连续权重中恰有两个为零。尽管这一机制具备显著的加速潜力,但 50%…
破解AI幻觉黑盒:大模型如何判断自己说的是真是假?
当你向AI模型询问“法国大革命期间,路易十六被处决的具体日期是哪一天”,它能迅速给出“1793年1月21日”的标准答案。可当你追问某个冷门的地方戏曲流派起源时,它却可能面不改色地编造出一个听起来头头是道的虚假地名。这种一本正经地胡说八道的现象,就是大模型的幻觉。 这种幻觉不像代码报错那样直接崩溃,而是以极高的可信度输出错误信息。在闲聊场景中,这或许只是茶余饭后的笑料,但在医疗、法律或金融等关键领域…
AI 能考过计算机等级考试吗?
如果让今天最强的大模型去参加一场国家计算机等级考试(NCRE),它能拿多少分? 近期,微软亚洲研究院的研究员们把 NCRE 一、二级的 200 道 Word、Excel、PPT 实操题搬到 AI 面前,让 7 个前沿大模型作答,并用官方评分引擎逐条打分。然而,测试结果却与我们的直觉大相径庭:在普通考生普遍能拿满分的考试中,最强单轮模型只考了 36.6 分;即便是配上了能反复执行调试的“编程智能体”…
大模型智商在线,为何“情”商掉线?
如今的大语言模型早已在数学领域展现出令人惊叹的实力,在 AIME 美国数学邀请赛、IMO 国际数学奥林匹克竞赛等高难度抽象数学竞赛中,多款主流模型都能交出近乎满分的答卷。这一表现也成为大模型推理能力持续突破的亮眼标签。 但是,这些在抽象数学题中所向披靡的“学霸”,面对藏在现实场景中的数学问题时却频频失手,抽象解题能力始终无法转化为可靠的现实应用能力,形成了巨大的性能落差。比如模型能精准解出抽象的数…
告别盲猜token时代,LTD赋予大模型“时间感知”能力
慢,越来越慢…… 你在使用大模型时是否也面临这样的无奈:AI的回答总是需要等待,敲完一个问题,要等上几秒甚至十几秒才能得到回复,在复杂推理、多轮对话或代码生成等场景中,可能还需要更长的时间。 推测解码方法一定程度上缓解了这一延迟问题。它通过引入一个更快、更小的草稿模型,先猜一些可能的词元(token),再由大的目标模型统一验证,从而减少逐步生成的时间。然而,其现实效果并不总是理想的。由于推测解码采…
语音识别技术在近年来取得了飞速发展,但在面对真实的复杂场景时,许多系统依然显得有些力不从心:漫长的会议、多人混杂的交谈、极具专业性的行业术语,或是中英夹杂的日常对话…… 传统的语音识别系统往往需要将长音频切分成一个个短小的片段,分别识别后再费力地“拼凑”起来。这种“化整为零”的方法不仅容易丢失上下文,还常常在谁说了什么、什么时候说的等问题上张冠李戴。 近日,微软亚洲研究院发布了一款通用的语音识别模…
别让AI在部署后停滞:OEL重塑大模型进化之路
大模型部署之后能力还可以持续提升吗? 如果去问AI开发者这个问题,在过去,答案大多是否定的。传统的大模型在出厂那一刻,其智力水平就几乎定型了。即便在实际应用中遇到了未见过的新问题,或者被用户反馈指出错误,模型也很难像人类一样,在下一次尝试时立刻吸取教训。这正是当前大语言模型面临的尴尬现状。 在现有的主流范式下,AI模型性能的提升高度依赖于离线训练,要么是昂贵的人工标注,要么是预先构建的模拟环境。一…
In recent years, as the shift toward agentic AI has accelerated, automation has advanced to handle increasingly complex tasks, from document and code generation to image creation, visual understanding, and mathematical reasoning. This trend points to the growing need to…
DocReward:让智能体“写得更专业”的文档奖励模型
编者按:当大模型已能“写对”内容,如何让文档也“好看、易读”成为办公智能体转型的新焦点。微软亚洲研究院携手香港中文大学、中国科学院大学提出了一个专注于评估文档“结构与样式”专业性的奖励模型 DocReward。该模型为智能体生成的文档提供了清晰、可量化的优化信号,使其不仅在内容层面准确可信,更在形式呈现上清晰有序、专业规范,为下一代智能办公智能体的落地奠定了关键基础。 近年来,随着智能体化转型(A…