罗马假日
Qwen3.8,登顶英伟达榜单!_我的网站

一 | 智东西(公众号:zhidxcom) 作者 | 程茜 编辑 | 云鹏 智东西7月22日报道,昨日,阿里千问最新发布的Qwen3.8预览版模型在英伟达评估AI进行算子优化的榜单上登顶,排名超过腾讯混元、人类开发者、Cursor。

二 | 榜单中SOL得分指的是GPU的峰值算力与HBM带宽共同决定的理论性能极限。 预防甲流,守护健康 ——预防甲流知识宣传 亲爱的家长朋友们: 目前正值甲型流感高发季节,预防流感等季节性高发呼吸道传染病不容忽视,为有效控制流感在幼儿园的传播与蔓延,今天我们来认识一下甲型流感,最大限度地保护幼儿。

三 | 了解甲型流感 流感病毒分为甲、乙、丙、丁4型,人流感主要是甲型流感病毒和乙型流感病毒引起。甲流全称为甲型H1N1流感,是一种急性的呼吸道传染病,为甲型H1N1流感病毒感染引起。

四 | 可以通过呼吸道快速传播,甲流患者和隐性感染的病毒携带者为主要传染源,易引起大流行。模型这一分数越接近1,代表其生成和优化GPU算子能力越接近理论极限,可以在无需人类标注的情况下,通过与真实硬件环境的交互,自主产生训练信号、评估自身输出质量并持续改进算子。 “甲流”有哪些症状? A. 早期高热,体温可达39~40 ℃,一般持续2~3天后渐退。 这一榜单中排名第二的是腾讯混元Hyra、排名第四的是人类开发者Amir M. Mir、排名第六的是美国AI创企doubleAI的全自动GPU内核生成智能体系统、排名第十的是AI编程独角兽Cursor,其他项目暂未找到公开打榜记录。 B. 呼吸道其他症状:流涕、鼻塞、打喷嚏、偶有咳嗽等 C. 消化道症状:部分孩子会出现恶心、呕吐、腹痛等。

五 | D. 也可能伴有眼痛、畏光等症状。 “甲流”的传播途径 传播途径以空气飞沫为主,也可通过被病毒污染的物品间接传播,患儿发病后1—7天均具有传染性,病初2~3天传染性最强。 SOL-ExecBench榜单是今年3月,英伟达推出的GPU CUDA Kernel内核优化基准评测套件,面向Blackwell B200架构专门用来评测AI智能体、编译器、自动内核生成工具写出的GPU算子性能。 “甲流”和普通感冒的区别 做好家庭日常防护 减少去人多密集的地方 甲型流感病原主要通过人们呼吸道分泌物的飞沫传播。Qwen3.8登顶的FlashInfer-Bench子集,就是专门用于测试和优化大语言模型推理系统中的GPU算子。闭塞的房间也会让细菌和病毒密度上升,增加病原传染几率。 7月19日,阿里千问大模型团队宣布将很快发布并开源Qwen3.8。该模型参数2.4T,可能是除了Fable 5外最强大的模型。因此,室内要多开窗通风,家长也应避免带孩子去人多的地方。昨晚,Qwen3.8-Max-Preview更新,前端(WebDev)表现更好。

六 | 如不可避免应采取防护措施。若孩子已确诊或疑似传染性疾病,请停止来园,同时告知班级老师避免传染他人。

七 | 一、从124个模型中提取,共235项CUDA内核优化任务 随着AI智能体生成与优化GPU内核的能力持续增强,现有基准评测的一大局限暴露,其只看重相对软件基线的加速比,而非内核执行方案本身贴近硬件最优效率的程度。 远离“毒”源 家里有人感冒,应为患者佩戴口罩。

八 | 确诊感染甲型流感病毒应及时治疗,以免传染给幼儿。而在现代数据中心中,未能充分利用硬件的kernel意味着算力与能源的双重浪费。 基于此,英伟达提出了SOL-ExecBench基准套件。

九 | 引导幼儿在咳嗽或打喷嚏时用手帕或纸巾捂住口鼻。这一套件共有235项CUDA内核优化任务,提取自124个商用及前沿人工智能模型,覆盖大语言模型、扩散模型、计算机视觉、音频、视频以及混合架构,目标硬件为英伟达Blackwell系列GPU,涵盖BF16、FP8、NVFP4精度下的前向与反向计算负载。让幼儿远离甲型流感病毒携带者,避免与之近距离接触,以防感染。 讲究卫生,勤消毒 让幼儿在家勤洗手,多喝水,保持良好规律的作息,以增强身体抵抗力。

十 | 让幼儿在饭前便后洗手,拿了脏东西之后立即洗手。 与以往基于软件性能来进行评估标准相比,SOL-ExecBench的评估目标有所不同。

十一 | 家人外出回来应洗手,换衣之后再与孩子接触,减少病毒感染几率。其通过“Speed-of-Light(SOL)”界限来评估内核性能,即由GPU的峰值算力与HBM带宽共同决定的理论性能极限。幼儿的餐具应定期灭菌消毒。

十二 | 英伟达开发的SOLAR工具能够从FLOP数量、字节数、GPU峰值吞吐量以及带宽等方面,分析出这些基于硬件的SOL界限,然后将这些界限与预先定义的评分基准相结合,从而得出SOL评分。 具体来说,评分为0.5表示与基准值相当,评分为1.0表示达到了硬件上的SOL界限。因此,这个评分不仅反映了相对于基准值的改进程度,还体现了与最大可实现硬件性能相比所剩余的优化空间。

十三 | 除此之外,随着天气变化,及时为幼儿增减衣服。

十四 | 让幼儿进行适量的户外运动,保持室内空气流通,定期消毒等均可以降低患甲型流感的风险。 补充维生素 让幼儿多吃富含蛋白质和维生素的食物,促进代谢,提高免疫力。 为保证评分结果的可靠性和可重复性,SOL-ExecBench还包含一个沙盒评估工具。维生素能促进体内重要代谢,特别是维生素A和维生素C能增强皮肤和黏膜的功能,提高免疫力。此外基于其开发的智能优化算法,可以在相同的评估协议下改进提供的PyTorch参考实现,这种优化算法可以识别出那些试图操纵评估器的行为,即试图绕过评估机制以获得更快的运算结果。 此次Qwen3.8拿下第一的是FlashInfer-Bench子集,专门用于测试和优化大语言模型推理系统中的GPU算子。 该子集包含26个来源于Llama-3.1-8B、Qwen3-30B-A3B、DeepSeek-V3/R1的问题。 该子集覆盖的精度格式为BF16与FP8,每个问题提供7-48个动态形状的输入配置,覆盖真实生产场景,典型任务包括融合注意力(Fused Attention)、FP8 MoE和RMSNorm等推理关键算子。

十五 | 平时注意教育孩子多喝水,饮食要有规律,不暴饮暴食。

十六 | 增强体质,锻炼身体 每天让孩子进行适当的户外运动。

十七 | 适当晒太阳,阳光中的紫外线,能促进幼儿生长发育,促进钙、磷吸收,增强免疫能力。也可通过适宜的运动和游戏活动,强健他们的身体,提高免疫力。 根据官方披露,该测试套件中所有提交内容均在真实NVIDIA B200 GPU上隔离执行,GPU时钟锁定在1500 MHz以保证可复现性。

十八 | 二、榜单排名靠前,意味模型具备闭环自我改进潜力 Kernel优化是少数几个可以提供清晰、客观、可量化反馈信号的真实工程任务之一: 反馈明确:运行时间、吞吐量、带宽利用率可以精确测量; 标准客观:距离硬件理论极限还有多远,没有歧义; 迭代自然:每一轮优化都可以作为下一轮的起点。

十九 | 这意味着模型可以在无需人类标注的情况下,通过与真实硬件环境的交互,自主产生训练信号、评估自身输出质量并持续改进。 在SOL-ExecBench FlashInfer-Bench子集上表现靠前,就意味着模型在下面几项能力上具有优势: 长程因果推理:优化决策之间存在复杂依赖链,局部改动会影响全局性能,模型需要跨越长上下文进行一致性推理。 工具使用与环境交互中的策略规划:现实世界智能体任务面对多轮工具调用,模型需要根据每次执行反馈动态调整策略,而非机械执行预设步骤。 接种疫苗 接种流感疫苗是增强对病毒免疫力的有效方法,家长自愿让孩子接种。 家长需注意事项 1. 传染病流行季节,尽量少带幼儿去人群密集的公共场所,杜绝传染渠道,减少感染机会。

| 2. 合理安排户外活动,可增强幼儿自身免疫力。 稀疏反馈下的探索能力:性能提升往往不是线性的,模型需要在大量“看似合理但实际无效”的方向中识别真正有价值的优化路径。 系统级抽象与具体实现之间的双向翻译:从高层算法语义映射到底层硬件指令,再从硬件反馈反推优化方向,这种双向能力在科学计算、编译器设计、芯片设计等领域均有直接迁移价值。 3. 每天入园前请关注孩子的身体健康状况,当孩子出现发烧、呕吐、腹泻、疱疹等情况时,在没有明确病因前不要送幼儿入园,并及时与班级老师沟通孩子病因状况。 这也意味着,能在SOL-ExecBench上持续进化的模型,具备在客观物理约束下进行闭环自我改进的能力。 4. 请家长配合幼儿园做好每日的晨检工作,如果在晨检时保健医发现幼儿有异常情况,请您积极配合我们,及时带孩子到正规医院就诊。 三、训练侧搭建真实GPU环境,推理侧引入阿里智能体框架 智东西从千问团队获悉,在训练、推理方面,千问团队均针对Kernel Self-Evolving进行了优化。 幼儿园做好防控教育 预防甲流 我们在行动! ● 健康检测 坚持每日做好幼儿晨检、午检、晚检工作,关注孩子全日健康状况。监测幼儿体温,幼儿出现发热等症状,通知家长接回及时就医,并追踪随访。 首先在训练侧,为了让模型真正具备kernel优化能力,而非仅仅学习表面的代码模式,其构建了一套基于真实GPU环境的大规模强化学习体系。 健康检测 ● 精细化“服务” 关注气温变化,提醒家长送幼儿来园时及时增加衣物。每天会根据天气状况,带幼儿进行丰富多彩的室内外运动,增强幼儿体质。 1、研究人员搭建了基于沙盒的真实GPU训练环境: 为模型提供丰富的硬件文档与可交互的Workspace,使模型能够通过真实编译、执行与性能测量获取来自硬件的奖励信号,而非依赖代理指标或模拟器。 引导幼儿养成良好的生活习惯,注意个人卫生,做到餐前、餐后,如厕前、如厕后、户外活动后、桌面游戏后勤洗手。

| ● 校园、厨房、班级 卫生消毒工作严抓不懈 坚持把常规性和应急性消毒工作作为重点来抓,严格执行卫生消毒制度。这可以确保每一个训练信号都有真实的物理意义。 2、真实Kernel仓库作为训练数据 研究人员系统性收集了大规模真实的工程级kernel优化代码,以这些真实世界的kernel作为训练query。 ● 健康知识科普 开展“幼儿健康教育”,将健康科普融入到孩子们的日常活动中。提醒家长特殊时期,尽量少带幼儿去人流密集、空气流通不畅的公共场所,经常组织教职工参加幼儿常见疾病预防知识培训,提高防病技能,做好疾病预防工作。 滑动查看所有内容 预防流感 记住顺口溜 流感季,要记牢; 勤洗手,习惯好; 多通风,要防寒; 不聚集,戴口罩; 勤锻炼,打疫苗; 防流感,要趁早。

| 相比合成数据,真实反馈覆盖了更广泛的优化模式、硬件适配策略与工程取舍,为模型提供了更接近生产场景的学习信号。 孩子是我们的未来,是我们的期望,维护孩子的生命健康是我们的共同职责。

| 3、RL基础设施的针对性优化 Kernel优化任务的一个显著特点是需要超长的工具调用序列,单次优化过程可能涉及数十乃至数百轮的编译-执行-分析循环。 为此,研究人员对强化学习训练基础设施进行了专项优化,使其能够高效支持超长多轮工具调用的训练,从而让模型真正学会跨越长序列的持续优化策略。让我们团结一心,科学防范,为孩子们创造更加安全、温馨的成长环境! 注:文中部分图片来源网络公开渠道, 非商业用途,若有侵权,请联系删除。

| 在推理侧,研究人员使用阿里巴巴Atrex Kernel Agent框架来承载算子优化的完整分析迭代流程与经验沉淀机制。 ▲阿里巴巴Atrex Kernel Agent框架和工作流(图源:GitHub) 在SOL-ExecBench FlashInfer-Bench子集的评测中,该模型完成了平均29354轮工具调用的持续迭代,在每一轮循环中对kernel实现进行编译、执行、性能分析与策略调整,将性能逐步推向硬件理论极限。 这意味着,模型在数万轮的迭代过程中可以保持方向一致性、持续产出有效优化、不陷入局部震荡,正是长程持续优化能力区别于普通代码生成能力的核心所在。 文案:冯佩仪 排版:戴俊燊 一审|冯瑞莲 二审|冯雪峰 终审|范峻婷。 结语:从手写算子到AI生成、调优,Qwen3.8刷新自动化算子生成能力上限 Qwen3.8此次登顶,意味着其有能力承担底层算力优化的复杂工程任务,并进一步压缩人工介入算子开发的工作环节,其能直接对接真实硬件环境采集运行反馈,形成从算子生成到性能调优的自动化闭环。

| 自动化GPU算子生成赛道的长期竞争,未来或取决于大模型理解硬件架构、推演访存瓶颈、自主迭代调参的综合智能水平。长远来看,伴随大模型能力升级,模型侧与编译层在算力优化方面将形成持续双向反馈,硬件规格、算子实现、模型架构三者协同演进可能会成为常态。
Current article:http://38wx8.ruwentaqintiaozhupapaigai.shop/news/20260826_326238.html
Published on:08:53:07
