这几个月国产模型的节奏有点吓人。GLM-5.2出来的时候,大家讨论的是它已经基本接近Opus 4.8了;Kimi K3发布后,很多榜单上比较对象直接换成了Fable 5;上周阿里又发了2.4T的Qwen3.8。国产模型是真的起来了。
最近,我又注意到一个走了完全不同路线的模型。别人都在拼通用旗舰,它把GLM-5.2整个拿来当地基,冻住不动,在上面训了四个小专家,说自己是个人模型。Mind Lab刚发布的Macaron V1:大概是全球首个基于GLM-5.2完成后训练的模型。
测新模型这件事我做过很多次了,但这个模型给自己的定位是个人模型,大致意思是日常生活里帮上忙、长期持续地帮助你。所以这次我换了个思路:拿我自己的人生来测它。我给他一股脑丢了我4580条即刻动态,然后让他试着给我提提人生建议,考察它对话风格的同时,顺便验证了一波它长上下文的理解能力。
LoRA的一种新用法
Macaron V1的结构在现在的大模型里算异类:748B参数,其中744B是GLM-5.2基座,整个冻住,一个参数都不动。真正训练的是挂在上面的四个1B小模型,官方叫它们LoRA专家。
LoRA玩AI绘画的朋友应该熟。想让一个练好的大模型多学点新本事,老办法是把它整个重训一遍,又贵,又容易让它把原来会的忘掉。LoRA换了个思路:原来的模型碰都不碰,只在旁边挂一小块新的,用的时候接上去,像给它加个可拆卸的小插件。2021年微软研究院提出,后来画风、人物模型满天飞,用的都是它。不过一直以来,它更多被当成一种省成本的权宜之计。
Mind Lab这次把它的位置往上抬了一档,这个思路我挺认同:这一小片参数,更像一份持久的本地状态。基座提供通用能力,是共性;适配器承载一个人的偏好、习惯、用工具的方式,是个性。理由也讲得通,基座本身已经足够强,部署后的学习大多不是从零建能力,而是把它已有的知识重新组织一下,所以很小的更新也能撬动很大的空间。
他们把这事推到过极限。在一篇叫《On the Scaling of PEFT》的论文里,适配模块压到每层只留一个可调方向还能稳定地学,参数量压到基座的0.5%以下照样管用,算力只要全量微调的十分之一,而且基座越强,这种小更新反而越有效。
于是LoRA在他们手里,从一次性的微调手艺变成了能攒、能管的东西。MinT平台上已经建了一个百万级的LoRA目录,每个都有独立身份和版本历史,评测过了才上线,随时能回滚。
回到Macaron V1,四个LoRA专家按思维方式分家:L0管聊天,L1管个人生活里的任务执行,L2管写代码,L3管生成界面。每次请求进来,路由器决定交给谁,他们叫这套MoL,Mixture of LoRA。聊天、编程、用工具背后的思维差异很大,硬塞进同一组权重会互相打架,编程练强了聊天可能变蠢;分开各练各的,以后加新能力插一个新LoRA就行,不动老权重。
命名也挺好玩,这次V1有两个尺寸:748B旗舰版叫Venti,超大杯;35B小尺寸版叫Tall,中杯,基于通义千问3.6训练、专为本地部署准备。星巴克杯型,比满大街的Pro、Max、Ultra好懂多了。
这是他们和前沿模型同台的benchmark图:

我觉得看点是他们在个人生活类和生成界面类的基准上领先或持平,编程类也接近现在的顶尖模型,毕竟是拿GLM5.2训练的,基础能力有保障的同时,又通过LoRA补进了她们在chat、coding、agent等方向上的认知,这个表现我觉得很合理。
接入
现在这个模型已经发布,想测试的话,也很简单,模型平台叫MinT,OpenAI和Anthropic两种兼容端点都有。你可以很轻松改个配置就让Claude Code直接跑在Macaron上:

国内有独立入口 mintcn.macaron.xin 定价输入每百万token 8元、输出28元。平台上还挂着glm-5.2基座本尊,可以直接调用。这个设计我很喜欢:官方自带对照组。同一道题给Macaron V1和基座各跑一遍,后训练到底改变了什么,一测就知道了。
把我的4580条动态喂给它
第一个大测试,喂它吃我的人生。
我从2019年起的全部即刻动态有4580条,65万字,导出来整个塞进一次请求里。
先是真题:我最早一条关于小猫补光灯的动态是什么时候发的?它定位到2024年11月4日,把原文引了出来,「花一个小时用Cursor做了个『小猫补光灯』,默认有紫光、粉光、蓝光、白光这四种女生常用的补光色」。我grep了原始档案,逐字准确。
然后是陷阱。我问它:帮我找那条「我熬夜用Swift亲手写完了补光灯代码」的动态。这条不存在,我从来不会写代码,档案里4580条动态可以作证。它先明确说档案里没有这条,你可能记忆有误;然后把最接近的真实动态翻出来,11月11日那条复盘,指出我写的是用Cursor花1小时写完代码,身份是「不会写代码非工程师出身的人」。它没有顺着我编,并且实实在在的用大海捞针的方式找到了我写过的相关表达纠正了我的记忆。
当然,只是会读上下文不出幻觉也不算懂我,在挂着Macaron的Claude Code里,当着我整个写作工作区的面,我先让他帮我梳理了以下我最近几年的工作和生活的关键转变,讲道理,有点头皮发麻,这些信息梳理得也太特么精确了。


然后我问他:你怎么看待我做了这么多事,下个阶段我的工作重心该怎么调整?
它的回答第一句是:「你不是缺机会,你是机会太多、杠杆太散。」行,直接开怼。后面的建议我不全贴了,大意是让我少接散活、把一个东西做厚,每一条都点着我真实的项目和数据在说,全程没一句夸我,等于拿我自己的履历给我泼冷水。


这个玩法你可以照抄:让它当着你全部工作文件的面,问一个你真正悬而未决的问题。模型没读过你的东西时,答案是职业规划模板;读过之后,答案才开始值钱。
编程:拉来K3和Opus同台
编程上我给整了个难题,之前我在X上看到一个200多万浏览的设计,是一个设计师发过的展示前段效果的一个概念设计:悬浮的故宫金顶下面挂一条汉字字帘,交互时几千个字符像水流一样拧动缠绕。我把它拆成纯文字需求让四家复现:不给任何图片素材,屋顶用代码画,字符流动用噪声场驱动,禁用一切外部库。这题专门考复杂前端视觉能力。

K3和Opus的还原度超出我预期:奶油纸底、衬线标题、缘分注脚、密度接近原版的字帘,两家还各自给网站起了品牌名。Qwen的字帘太稀,散落的字符像飘雪不像水帘。Macaron V1的版本也立住了:字帘的密度和流动感都在线,屋顶也是纯代码画的,过程里它还自己起了个无头浏览器,读运行时的粒子数组验证「瀑布宽度、与文案区重叠的粒子数」这些指标,自己改自己验,这大概更接近它被设计出来的用法。

所以我的判断是,这个模型的编程能力大体是低于Kimi K3、约等于Claude Opus 4.8、高于Qwen3.8的水平。
编程这条轴上我还做了个更好玩的测试:让它把经典坦克大战改造成主题游戏。我丢给它一份邮轮旅行指南,让它把里面的知识做进游戏里。

它先交回一张设计对照表让我确认方向,然后我看到了这次测试里我最喜欢的一个细节:指南里的知识全焊进了游戏机制里。指南里写航海日风速33公里每小时,游戏里那一关敌人移速加30%;某天降雨概率96%,就变成一个6滴血的暴雨BOSS;末班摆渡船15点开走,就是一个倒计时清场关。7天行程做成7关战役,甲板餐厅是可破坏掩体,圣殿静区是护盾道具。交付前它还做了程序化验证:像素统计确认每种元素渲染正确,逻辑测试跑通射击、掩体三血、道具拾取。

实机跑起来是这样的:

Agent能力实测:我把自己的开源仓库交给了它
编程轴收官前,我玩了个大的。我的huashu-design仓库攒着一些open issue,我让接了Macaron的Claude Code自己去看:挑一个方向明确、有价值的修掉,直接提交,commit里注明你的模型身份。
它挑了47号issue,有用户反馈用skills CLI安装这个skill时,子目录会被丢掉。接下来的处理我有点意外:它没有上来就改代码,而是先装了最新版CLI实测复现,发现这个bug上游在1.5.19版已经修了,用户报的是旧版本的问题。所以它做的是最小改动,在README的安装段补了三件事:装完怎么自检、旧版怎么识别升级、git clone兜底方案。然后commit、push,再到issue下面留言,@了反馈的用户,附上各子目录的实测文件数,署名Macaron-V1-Venti-Coding。

说实话,这个不是一上来就瞎折腾,知道先验证问题还在不在、再决定动不动手的判断,是一个可以进入loop engineering循环的agent模型真实需要的能力。
UI4A:模型直接把界面画给你
UI4A是四条能力轴线里最新鲜的,全称UI for Agents。普通模型回答你的方式是一段文字,最多给个HTML文件让你自己打开;UI4A是模型直接输出界面组件,配套运行时当场渲染,你看着一个能点能拖的界面在对话流里一块块长出来。你问它一个健康计划,它回你的可以是一块能填数字的卡片加一张图表,而不是十条建议的清单。
官方给这套架构的说法是:兼具HTML的灵活和结构化协议的可控,而且不挑模型,没经过微调的基座模型也能驱动,只是Macaron专门拿一个1B专家朝这个方向训透了。
上手不复杂。配套的Macaron Artifacts插件在Claude Code插件市场就能装,仓库在 https://github.com/mindverse-ltd/macaron-artifacts 装完本地会起一个预览页面。之后在挂着Macaron的Claude Code里正常提需求,说一句「做成UI4A形式给我看」,预览页面里就能实时看到界面被一块块画出来的全过程。
我拿两个自己的东西试了它。
一个是我的小猫补光灯。我让它把那台上架App的补光台,做成能在对话里直接点的控制台:中间一个发光圆盘当补光面,三个滑杆管色温、亮度、色相,一排马卡龙色卡点一下换主色,底下一个「猫爪补光」按钮,按下去光晕开始暖白呼吸。
而且过程也挺值得一说的。它不是一次画对的,中途报过组件属性用错、import路径写错,每次自己看到报错就地改,改的时候界面停在上一版能渲染的样子,不至于白屏,改完接着往下画。等它收尾我拖了下色相滑杆,圆盘的染色是真跟着流动的。

另一个更随手,一个马卡龙呼吸灯番茄钟。中间的圆随呼吸缩放发光,颜色随剩下的时间在薄荷绿和蜜桃粉之间挪,倒计时数字缓动着跳,下面开始、暂停、重置加几个时长预设。这不是什么有技术含量的测试,但是氛围感还不错,以及主要是想让你感受下马卡龙Macaron Artifacts的实际体验。

写在最后
测完两天后,说下我的判断。
从Macaron V1的训练方式和benchmark来看,他们没打算争SOTA模型的地位。它大概赌的是:个人助理这个场景,需要的是一组合身的专才,外加越用越懂你的机制。所以目前把最核心的四种能力拆成四个1B插件;评测基准里放着跨数周交互、对用户诚实这种一般跑分榜上不存在的维度;官方还给模型配了能跨会话积累工具的REPL环境,模型自己写的工具下次任务还在,逐步攒出自己的工具箱。
同时在训练侧,他们的LongStraw系统把强化学习训练做到了210万token的上下文规模,意思是长上下文不只拿来推理,还能进训练。如果这事能完整兑现的话,个人模型的故事就算是真的走通了。
实测下来的短板也在:复杂视觉编排这类活离Kimi K3还有一小段距离(但要知道K3都上了前端Arena榜单第一,压Fable5和GPT-5.6一头了,这倒也合理),以及在复杂任务上Macaron思考链很长,单轮问答能把人等急,它更适合被放进agent环境里干活,别拿它当秒回的快模型用。
但我愿意继续看它长。尤其当它能把一份邮轮指南焊成七关战役、把我三年的人生节点梳理得头皮发麻时。
这两年模型圈的主线一直是更聪明,榜单跑分卷的都是同一道题。个人模型是条岔路:聪明有公认的排行榜,懂不懂你,只有每个用户自己能打分。Macaron未必就是这条路的终点,但有人认真往这个方向探,我挺高兴的。
同一个问题,读过你65万字的模型和没读过的,给出的是两种答案。我猜用不了多久,每个人都会想要一个读过的。

