首页 | 爱情文章 | 亲情文章 | 友情文章 | 生活随笔 | 校园文章 | 经典文章 | 人生哲理 | 励志文章 | 搞笑文章 | 心情日记 | 英语文章 | 会员中心
当前位置:文章故事>爱情文章>文章内容 经典美文欣赏

二次初恋

Macaron-V1:RL,让 GLM5.2 再次伟大_我的网站

秘密花园

A |     新鲜速递                    最近几天,模型行当风起云涌          而我们的 MindLab 也拿出了的作品 Macaron V1:通过后训练,让 GLM5.2 再次伟大          MindLab 成立于去年 12 月,现如今是唯一完成对 GLM-5.1/5.2 完成后训练的外部团队Mind Lab 成立|64 张卡跑万亿参数 RL,开源                    作为当下国内最受瞩目的 NeoLab 之一,本文重点聊聊 MindLab 他们的模型成果、技术路线以及优化方式                    模型与训练          NeoLab 的研究方向,是在现有基模下进行 LoRA 训练,即:对现有模型,取出大约 0.5% 的核心参数来训练,并有效的提高原有模型的素质。在 MindLab 成立之初,这套方法就在在 Kimi K2 进行了验证:64 张 H800 搞定万亿参数模型的强化学习                    但后训练有个经典难题:对话、推理、编程、工具调用等能力混在一起训,往往按下葫芦浮起瓢。在CES 2019年主旨演讲中,黄仁勋大部分时间都离开了赛场。因此,2019年的因维达CES展自然会包括新产品和新技术。团队为此独创了 Mixture-of-LoRA(MoL):在冻结的基座上挂载多个独立的 LoRA 专家,每个专家专精一个方向,各自在隔离的适配空间中优化,彻底消除能力间的相互干扰。这套方法先是在 GLM-5.1 上跑通了预览版 Macaron-v1-Preview          随后,也就是在正式版 Macaron V1 中,团队把基座换成了 GLM 5.2,并对模型能力进行了全面升级          V1 提供两款变体:          旗舰 Venti(748B):基于 GLM-5.2(原生 1M 上下文),通过 4 个 1B 的 LoRA 专家分别覆盖 Chat、Agent、Coding、UI 四大方向,切换由显式 Router Tool 控制,未来新增能力的话,只需再挂一个 LoRA          轻量 Tall(35B):基于 Qwen 3.6 后训练,专为本地部署优化。在特别的游戏演示室里,我们看到了Geforce RTX 2060笔记本,一款全新的G-Sync显示产品,以及一款65英寸的Omen Eperium 65 bfgd显示屏,即将出售。                   同时,团队还通过自研的 LongStraw 技术,将 GLM 5.2 的上下文扩展至 2M,并通过将共享提示词复用为常驻状态,大幅降低长序列开销。G-SYNC重新进化G-SYNC和Geforce图形卡无疑是完美的匹配。在新闻发布会上,英伟达将G-Sync细分为三个级别,最低级别为无G-Sync,其次为G-Sync兼容,最高级别为G-Sync终极。除了模型本体,团队还同步打造了三个关键配套,与模型联合训练:          UI4A:通用生成式 UI 架构,让模型能渲染交互式视图(不仅是文本),不依赖特定基座,即使未经微调的模型也能驱动,独立于 Macaron 的通用底座          REPL Harness:为模型提供持久的 Python 运行环境,模型可用 save_tool 自行编写工具,用 promote_tool 将其提升为跨会话可用的全局工具          MinT 后训练平台:MindLab 自研的训练基础设施,核心设计是 Actor 与 Learner 之间只传递 Adapter(而非完整权重),天然契合 MoL 架构,支持百万级 Adapter 目录,端到端可覆盖万亿参数规模                         模型跑分          我曾经问锴杰,怎样才能让模型智能不断提升?得到了一个回答:来自真实产品环境的奖励函数          从模型愿景上来说,马卡龙是希望能够在日常生活中真正帮上忙,并且是长期持续为创造价值,为此他们自建了两个基准,用于指导模型训练,如下:          Macaron ChatBench          作为 Agent 最基本的能力,需要评测 Agent 在长上下文中是否对用户保持诚实,而非「先把事情搞砸,然后道歉」          Macaron LivingBench          这是一个模拟的沙盒环境,包含三种相互关联的动态机制:动态噪声、动态生存环境以及动态用户。评测观察模型是否能够持续理解用户的需求,验证信息准确性,重新规划任务路径,在用户保持耐心的情况下完成任务,说白了:完成任务,然后提供更好的体感                    除此之外,还有一些常规 Bench,也让大家看一下成色          benchmark 对比图          除此之外,我不知道是不是由于还在内测,用的人很少...就是这个模型快的离谱,我让他自己写了个自己的测速脚本,然后看看自己的速度:320字/秒          我觉得它在糊弄我...于是我还录了个屏,让他做打点标记          播放          下一个          打开循环播放          00:00     /     00:00          倍速          3.0X     2.0X     1.5X     1.25X     1.0X     0.75X     0.5X          多音轨          AirPlay          0          静音播放中,点击 恢复音量          画中画          网页全屏          全屏          你可以 刷新 试试          视频信息     1.33.6          播放信息 上传日志 调试信息 [X]          视频ID     VID     -          播放流水     Flowid     -          播放内核     Kernel     -          显示器信息     Res     -          帧数     -          缓冲健康度     -          网络活动     net     -          视频分辨率     -          编码     Codec     -          mystery     mystery     -          按住画面移动小窗                    我问锴杰:对于推理速度,你们干了啥?          锴杰:的确做了速度性能的优化,但太强调的话,我怕后面大家体验如果和你的实测指标不一致,会生气          好的,我绝对不说速度的事儿,另外还有个事情我得说一下,在我写这篇文章的时候,我让 Macaron 帮我去迭代了我的「大撒币计划」:速测 Qwen3.8 预览版:我用 1 小时,开发了套撒币系统          我是这么要求他的...四舍五入啥也没说,让他自己干          然后...它帮我迭代了所有的 ux,并且额外修了点 bug                              看几个案例          这里我就直接放点官方的 Case 了          Coding:用 Three.js 做了一个夜航船 3D 网页。第一人称站在木船上,河灯飘在两侧,靠近时浮出诗句          播放          下一个          打开循环播放          00:00     /     00:00          倍速          3.0X     2.0X     1.5X     1.25X     1.0X     0.75X     0.5X          多音轨          AirPlay          0          静音播放中,点击 恢复音量          画中画          网页全屏          全屏          你可以 刷新 试试          视频信息     1.33.6          播放信息 上传日志 调试信息 [X]          视频ID     VID     -          播放流水     Flowid     -          播放内核     Kernel     -          显示器信息     Res     -          帧数     -          缓冲健康度     -          网络活动     net     -          视频分辨率     -          编码     Codec     -          mystery     mystery     -          按住画面移动小窗          夜航船 3D 网页(马卡龙版)          同样的 prompt,GPT 5.6 也做了一版          播放          下一个          打开循环播放          00:00     /     00:00          倍速          3.0X     2.0X     1.5X     1.25X     1.0X     0.75X     0.5X          多音轨          AirPlay          0          静音播放中,点击 恢复音量          画中画          网页全屏          全屏          你可以 刷新 试试          视频信息     1.33.6          播放信息 上传日志 调试信息 [X]          视频ID     VID     -          播放流水     Flowid     -          播放内核     Kernel     -          显示器信息     Res     -          帧数     -          缓冲健康度     -          网络活动     net     -          视频分辨率     -          编码     Codec     -          mystery     mystery     -          按住画面移动小窗          夜航船 3D 网页(GPT版)                    Agent:从零构建一个混沌磁摆模拟器。小球在重力、阻尼和三枚磁铁作用下运动,实时渲染分形区域          播放          下一个          打开循环播放          00:00     /     00:00          倍速          3.0X     2.0X     1.5X     1.25X     1.0X     0.75X     0.5X          多音轨          AirPlay          0          静音播放中,点击 恢复音量          画中画          网页全屏          全屏          你可以 刷新 试试          视频信息     1.33.6          播放信息 上传日志 调试信息 [X]          视频ID     VID     -          播放流水     Flowid     -          播放内核     Kernel     -          显示器信息     Res     -          帧数     -          缓冲健康度     -          网络活动     net     -          视频分辨率     -          编码     Codec     -          mystery     mystery     -          按住画面移动小窗          混沌磁摆模拟器          播放          下一个          打开循环播放          00:00     /     00:00          倍速          3.0X     2.0X     1.5X     1.25X     1.0X     0.75X     0.5X          多音轨          AirPlay          0          静音播放中,点击 恢复音量          画中画          网页全屏          全屏          你可以 刷新 试试          视频信息     1.33.6          播放信息 上传日志 调试信息 [X]          视频ID     VID     -          播放流水     Flowid     -          播放内核     Kernel     -          显示器信息     Res     -          帧数     -          缓冲健康度     -          网络活动     net     -          视频分辨率     -          编码     Codec     -          mystery     mystery     -          按住画面移动小窗          3D魔方          然后这里还有个我觉得很有意思的 Case:3D 二维码...          (提问:3d二维码是几维码?)          播放          下一个          打开循环播放          00:00     /     00:00          倍速          3.0X     2.0X     1.5X     1.25X     1.0X     0.75X     0.5X          多音轨          AirPlay          0          静音播放中,点击 恢复音量          画中画          网页全屏          全屏          你可以 刷新 试试          视频信息     1.33.6          播放信息 上传日志 调试信息 [X]          视频ID     VID     -          播放流水     Flowid     -          播放内核     Kernel     -          显示器信息     Res     -          帧数     -          缓冲健康度     -          网络活动     net     -          视频分辨率     -          编码     Codec     -          mystery     mystery     -          按住画面移动小窗                    对了,测试 UI4A 可以用 Mind Lab 发的 Claude Code 插件 Macaron Artifacts          `github.com/mindverse-ltd/macaron-artifacts`                    接进 Claude Code          现在大家基本都在用 Claude Code 调各种模型,我整理了一下接法          打开 CC Switch,选顶部 Claude Code 图标,点右上角 `+`,选「手动添加」          Name 随便填,比如 `Macaron-V1`,Base URL、API Key、Model 都留空,核心是下面这段 JSON:          {      "env": {      "ANTHROPIC_BASE_URL": "https://mintcn.macaron.xin",      "ANTHROPIC_AUTH_TOKEN": "sk-xxxx",      "CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC": "1"      },      "model": "macaron-v1-coding-venti"     }          CC Switch 配置截图                    我是看着 Mind Lab 从成立的,看着他们团队建立,看着他们跑通 MoL,再到发布自己的模型,不断着验证自己的判断:通过后训练让模型持续变强,经由多专家协同让能力可生长。G-Sync兼容并不意味着它必须为G-Sync技术而构建,但在Nvidia的实际测试中,它仍然能与G-Sync显示出良好的兼容性,这意味着它可以在不付出太多成本的情况下实现与G-Sync显示类似的性能。在超过400个可变刷新率监视器的实际测试中,只有12个监视器符合G-SYNC兼容标准,NVIDA慷慨地给出了推荐购买列表供玩家参考。

B | 顾名思义,G-Sync Ultimate是下一段时间内G-Sync的最高标准。它将代表所有高端显示技术的集合,例如需要支持HDR 10、高可变刷新率、超低响应时间、配备G-Sync芯片等。英维达还展示了一些尴尬的只支持自由同步显示在游戏过程中,如闪光屏幕,绘画撕裂等。似乎在N卡前面的自由同步的强制打开没有太多好的水果吃。

C | 当然,英伟达对朋友的支持也不缺,比如35英寸的罗格-斯威夫特PG35VQ将被出售。

D | 它不仅支持G-SYNC 3440 x 1440,而且刷新率为200赫兹。价格似乎不便宜。更便宜的是即将推出的bfgd 65英寸显示器omen eperium 65,最大4K 144Hz加上G同步和屏蔽功能。毫无疑问,惠普甚至减轻了显示器的重量,使其在正式量产之前更容易搬运和挂在墙上。同时,这种显示器在国外的价格接近5000美元,足以让我们买一台高端4K电视机。Geforce RTX 2060笔记本到Geforce RTX 2060图形卡以及Geforce RTX 2080、RTX 2070笔记本也在现场展出。在Geforce RTX 2060的测试中,我们发现Geforce RTX 2060的性能与Geforce GTX 1070 Ti相当,但DLSS和RTX使其更具吸引力。现场演示也是如此。通过游戏优化和DLSS合作,Geforce RTX2060可以在保证高质量的前提下轻松实现光线跟踪效果和高帧数,这也使得视频卡本身具有成本效益。RTX笔记本可能是游戏笔记本玩家最容易达到高潮的产品。现场显示笔记本电脑包括Microstar GS65、Lenovo Y740、Razer Blade 15、Alienware M15、Rog Zephrus S GX531、Acer Preditor Triton均使用Geforce RTX 2080 Max-Q图形卡,而HP Omen、Giga Aero 15和Microstar GS75则使用Geforce RTX 2070 Max-Q玩游戏。演示、流利、管理得当就足够了。

E | 关键是Geforce RTX系列图形卡笔记本电脑也更容易获得完整的游戏体验。毕竟,你不需要额外的G-SYNC显示器,笔记本电脑制造商也不会通过成本控制夸大他们的价格。可以肯定的是,2019年的钱包生活注定是艰难的。无论是Geforce RTX笔记本电脑、G-Sync显示器还是台式电脑,都有很多花钱的理由,而且这些产品中的许多很快将在第一季度上市销售。似乎如果没有2019年的Computex,今年的PC升级预算将耗尽。

Current article:http://hwg.xuanliaruamibinmilangca.shop/news/20260826_512289.html

Published on:15:48:29


Copyright © 2007-2014 我的网站 版权所有.情感文章,散文随笔,美文故事在线阅读