GitHub Copilot 不再纯云端 AI 模型:Surface Laptop Ultra 本地推理吞吐量最高每秒 63 词元

2026-10-08 09:53:02
来源:IT之家
分享
AIME

问财摘要

1、微软在旧金山发布会宣布,GitHub Copilot将在本月底前支持本地AI模型推理,开发者可在云端模型与设备端模型之间自动或手动切换。 2、GitHub Copilot是微软推出的AI编程助手,可集成于Visual Studio Code、CLI等工具,根据代码上下文生成补全、解释或重构建议。 3、微软为GitHub Copilot用户提供两种模式:自动编排或强制使用设备端模型。本地模型选择支持指定提供程序、模型或端点。 4、微软推出MAI Code 1.1 Flash“混合专家”模型,总参数1370亿,活跃参数68亿,采用量化与推测解码技术优化响应速度与内存占用。该模型在Surface Laptop Ultra上实测显示,复杂任务中的峰值内存使用率、Token利用率与处理速度均显著提升。
免责声明 内容由AI生成
文章提及标的

IT之家 10 月 8 日消息,太平洋(601099)时间 10 月 7 日上午 10 点(北京时间 10 月 8 日凌晨 1 点)在美国旧金山举办的发布会中,微软(MSFT)宣布 GitHub Copilot 将在本月底前支持本地 AI 模型推理,开发者可在云端模型与设备端模型之间自动或手动切换。

GitHub Copilot 是微软(MSFT)推出的 AI 编程助手,可集成于 Visual Studio Code、CLI 等工具,根据代码上下文生成补全、解释或重构建议。

GitHub Copilot 目前依赖云端托管模型,由协调器根据性能、成本与准确性路由请求。微软(MSFT)计划在本月底扩展该机制,允许 Copilot 自动选择云端模型与本地 AI 模型,后台协调推理任务。

微软(MSFT)为 GitHub Copilot 用户提供两种模式:自动编排或强制使用设备端模型。用户可在 GitHub Copilot CLI、Copilot 应用与 Visual Studio Code 中设置偏好。

本地模型选择支持指定提供程序、模型或端点,开发者可通过 Windows ML 选择 MAI Code 1.1 Flash,或连接 OpenAI 兼容的本地端点并选用其暴露的模型。

微软(MSFT)推出 MAI Code 1.1 Flash“混合专家”模型,总参数 1370 亿,活跃参数 68 亿,采用量化与推测解码技术优化响应速度与内存占用。

该模型在 Surface Laptop Ultra 上实测显示,复杂任务中的峰值内存使用率、Token 利用率与处理速度均显著提升。解码吞吐量测试显示,提示长度从 2K 到 256K Token 时,吞吐介于每秒 40 至 63 个词元。IT之家附上相关图片如下:

免责声明:风险提示:本文内容仅供参考,不代表同花顺观点。同花顺各类信息服务基于人工智能算法,如有出入请以证监会指定上市公司信息披露平台为准。如有投资者据此操作,风险自担,同花顺对此不承担任何责任。
homeBack返回首页
不良信息举报与个人信息保护咨询专线:10100571违法和不良信息涉企侵权举报涉算法推荐举报专区涉青少年不良信息举报专区

浙江同花顺互联信息技术有限公司版权所有

网站备案号:浙ICP备18032105号
证券投资咨询服务提供:浙江同花顺云软件有限公司 (中国证监会核发证书编号:ZX0050)
AIME