微信原生AI助手“小微”近期灰度测试,其底层主模型为腾讯自研的WeLM系列——目前已官宣两个版本,核心在于用极低的推理成本(80B总参数仅激活3B)实现微信生态内的高效智能服务。
一、超高效稀疏架构:低成本支撑海量并发
参数规模与激活量:WeLM-80B总参数量800亿,但每次推理仅激活30亿参数,采用细粒度稀疏MoE(混合专家)架构。这种设计大幅降低了计算成本,适合微信14亿用户的并发调用。
资源效率优先:腾讯明确以“极致的资源效率”为WeLM系列核心目标,通过稀疏激活和量化技术,在中等算力下即可运行,支撑小微对消息发送、群聊总结等高频短交互任务的实时响应。
二、深度整合微信生态:长上下文与结构化召回
超长上下文窗口:支持128k tokens(约9-10万汉字),可完整处理长群聊记录、长篇公众号文章及多轮对话。
数据结构化调用:WeLM并非简单问答模型,而是通过结构化召回技术直接定位聊天记录、小程序页面等结构化数据,实现“一句话调起服务”的能力,如自动读取朋友圈配图生成文案、调用美团小程序点单等。
生态定制优化:针对微信内的支付风控、小程序调用链路、朋友圈编辑框等原生场景进行专项训练,确保指令执行的准确性与安全性。
三、隐私优先与推理效率:平衡能力与边界
隐私保护核心设计:腾讯财报明确表示“小微由专注于用户隐私、微信场景和推理效率的定制化模型WeLM驱动”。关键操作(如发消息、支付)需用户手动确认,AI不能越权执行。
推理效率优化:通过模型蒸馏、动态批处理等技术,小微在灰度测试中响应速度普遍得到好评,如对话延迟控制在毫秒级,支持语音指令实时转文字并执行。
DeepSeek兜底机制:部分复杂推理场景会调用DeepSeek模型辅助回答,主从模型协同,既发挥WeLM的生态专长,又借助外部模型补足通用知识。


本文由AI生成











