智谱:转发 jietang 两周时间,GLM-5.3-Flash …


转发 jietang 两周时间,GLM-5.3-Flash 从首次在国内加速器上运行到完全支持所有生产流量,期间实现了 3.2 倍的端到端吞吐量提升。我一直想着是谁做了大部分工作:一个由 GLM-5.3 驱动的基础设施代理。模型自己帮助优化

转发 jietang 两周时间,GLM-5.3-Flash 从首次在国内加速器上运行到完全支持所有生产流量,期间实现了 3.2 倍的端到端吞吐量提升。我一直想着是谁做了大部分工作:一个由 GLM-5.3 驱动的基础设施代理。模型自己帮助优化了运行它的系统。条件很艰苦,内存和互连带宽有限,100 万 token 的上下文,多模态请求,软件栈还不成熟,很多内核缺失,文档也经常需要猜。每次优化都是一个权衡:用计算换内存(ReplayS)。

—— 智谱 (@Zai_org) X帖子|2026-09-17T07:08:33+00:00
原帖:https://x.com/Zai_org/status/2100482396676112856



扫描二维码,在手机上阅读

SemiAnalysis:目前,微小型VCSEL在大规模互连领域正激烈竞争。垂直腔面发…

智谱:强烈推荐@Fei2411做的这个价格表和网站。它比较了订阅价…

评 论
评论已关闭