我给豆包手搓的技能,一晚上出了44个图标,免费开源!

前几天在家,我跟豆包说了句「做一个可爱卡通布丁小狗主题的记账app」,@上我自己搓的那个图标技能,选「工作任务」模式让它在我这台电脑上跑,看它起了个头,我就出门了。去公园遛了个弯,中间又约了朋友吃饭。

等我到家,活全干完了。

28个图标,一张张抠好、按用途命名好,它还自己拿这些图标拼出了一个原型。一条「全部完成」的消息早就在手机上等着我。

我给豆包手搓的技能,一晚上出了44个图标,免费开源!

在外面那段时间我也没完全撒手。手机上豆包接的是电脑那条同一个对话,它在跑,我在手机上又追加了几项要求、挑了几处选择,不用坐回电脑前,顺嘴就答了。

手机上选运行环境,连的就是我家里那台电脑

先看东西吧。

先看它干出来的活

布丁小狗那次,项目根本还不存在,一行代码都没有。它按「记账app的常见功能」的常识把清单列了出来——首页、记一笔、统计、预算这些导航位,餐饮、交通、购物这些分类图标,一个个标了用途和尺寸,28枚。

「布丁小狗记账App」的图标总览,28枚

图标先出来,界面调性、密度、可不可爱,看一眼就知道,不用先憋出一整个app才看得见。

它拿这些图标拼出来的原型,图标一到位,界面长什么样一下子就有答案了

这套图标不是一次性的,用的是同一个技能。在这之前我先拿自己的录屏app花录开的刀,界面上要用的图标四十几个,它自己读了项目代码,列出来44个,一晚上跑完:

我给豆包手搓的技能,一晚上出了44个图标,免费开源!

另一个技能是做PPT的。

我给豆包手搓的技能,一晚上出了44个图标,免费开源!

同一个技能,我让它换着审美重做,白板简笔画、信息手册风、Neo-Brutalism、构成主义、数据年鉴风,一共五套,我一版都没手动调过:

我给豆包手搓的技能,一晚上出了44个图标,免费开源!

这两个技能都是我在豆包里手搓出来的,也都免费开源了,地址在文末。

下面说说它们是怎么来的。

这活我半年前干不成

今年2月我写过一篇讲UI设计的文章,里面就有一套给app做图标的流程。

那篇文章到现在我都觉得挺有用的,但我发现这个做法虽然很多读者认可、喜欢,真用上了的人却有点少。

其实这套帮app或者网页做出更优质设计的流程本身不复杂,四步:

Step 1:先只做一个图标,多抽几次,抽到一个让你眼前一亮的风格,就把它存下来当垫图。

Step 2:让AI列出app需要的图标清单,照着清单一次性生成一张网格排列的大图。

Step 3:把大图切成一个个独立的透明png,按用途命名。

Step 4:放进项目对应的位置。

「更可爱」「更精致了」,即刻上读者留的原话

这套流程我自己用在「小猫相册」上,把整个app的图标换成了一套统一风格的小猫,底部tab栏是四只小猫在做不同的事,看书、写字、拿画笔、看身份证,发到小红书和公众号上都获得了不少好评,因为确实「更可爱」「更精致了」。

让多数人用不上这套流程的问题出在中间两步。通常你要换个工具,除了Codex外,像Claude Code、Open Code以及国内众多的coding类agent都没有生图能力。而一些具备生图能力的agent又是完全没法帮你开发。

所以通常而言,你需要多个工具联合使用,又或者,你具备给agent接独立的AI图片API的能力(能,但这一步确实卡住了很多人)。

做PPT也是同一个病。除了众所周知的Huashu Design之外,我手上还有个能做出好看PPT的流程,走的是每一页都当成一张图去生成,不走HTML截图那条路,出来的效果视觉上明显好一档。但它有个前提,之前它同样只适用于Codex,CC都完全用不了。

最近,我突然发现我这套工作流的复杂度问题突然能被解决了。因为国内确实出现了一个具备很好的agent能力,同时又内置SOTA级生图(以及生视频)能力的产品!!

那就是!!!豆包的「工作任务」模式!!!相信我,看完这篇文章你就知道你豆姐有多顶了。

这两个场景对工具的需求(强agent能力+强生图能力),同时被它接住了。

豆包的「工作任务」

我给豆包手搓的技能,一晚上出了44个图标,免费开源!

首先是,很多人可能还不了解,豆包现在除了「对话」,还多了个「工作」的入口——这其实就是agent能力的体现,选「工作任务」之后,你指定的不再是一句问答,而是让豆包自己拆解、执行一整个任务,你可以选它在云端跑,也可以选让它在你的本地电脑上跑。这套入口手机上也有,选完还能连你正在用的那台电脑——开头我人不在电脑前,靠的就是这个。

如果是在「本地电脑」的话,按 / 会出来一系列的技能,我试了下,发现除了少量豆包内置的,里面还有几十个,全是我这大半年给自己攒的,管PPT的、管校对的、管公众号配图的、管视频剪辑的,名字一个个都对得上。

没开「本地电脑」的时候,列表里就是豆包自己那几个

这些技能平时是给别的AI工具干活的,写在电脑的一个目录里,我没为豆包适配过一行,它自己读走了。而且这活不用我额外装什么App——豆包本来就在手机和电脑上都开着,打开「工作任务」直接就能用,比再装一个agent客户端轻多了。

开了之后,同一个位置弹出来的是这些

不过列表里出现是一回事,能不能真的准确执行是另一回事。毕竟现在很多skill能跑出来,对模型coding能力,以及模型所处的harness是有相当大关系的。

以及,我确实认真想了一个问题,就是我最近在评测和解读很多coding类或者work类产品的时候,大家都期望知道各个产品最大的特点是什么,对我来说分别会在哪些场景下使用哪个产品?

所以,考虑到豆包有国内最顶的生图模型Seedream5.0 Pro,我挑了两个很吃生图能力的skill做测试!一个做PPT,一个做成套图标。

测试1:让豆包改造重建skill

我跟豆包说,本地有个做PPT的技能,你把它改成调用你自己的生图能力,其他的操作流程和审美要求全都别动。

我给豆包手搓的技能,一晚上出了44个图标,免费开源!

然后我就看着它干活,过程比结果还好看。它先自己定位到技能所在的目录,主文件很大,它没有一口气全读,而是先定位到生图相关的位置再分章节读;接着做了个我没要求的决定,新建了一个目录复制原内容再改,把我的原件原封不动留着;改动点很多,它写了个Python脚本批量替换;改完自己全目录扫了一遍残留,发现几处脚本没匹配上的,逐个手工修掉;最后剩3处它判断是合理的多环境兼容说明,保留不动。

这一套动作序列,跟一个靠谱的工程师接手别人代码基本是一样的。

改完它自己列的清单,哪些换了、哪些原样留着

改完我就用新技能干活:做一份10页介绍LLM的PPT。它先做需求判断,把受众推断成学生、产品经理和跨领域的技术人,然后出了三个设计方向停下来等我选,一版信息手册风、一版Neo-Brutalism、一版白板简笔画教学风,每个方向都写了为什么适合、信息密度多少、风险在哪,还说明了它自己推荐哪个。我选了白板简笔画那版。

三个方向,它停在这儿等我

「动手前必须出三个方向等用户选」这条规矩是我写在原技能里的,它改造的时候把这条一起继承进了新技能,然后新技能自己遵守了。行为约束是可以被复制进衍生技能里的,规矩开始自己繁殖了。

后面执行也有两个地方我挺喜欢:它先出了封面加一张内容页当样张,确认风格稳定才开始批量(这是技能里写的策略,它照做了);中途下载图片超时,它自己改成分批下载,还检查了已完成的文件,没有一遇错就停在那等我。

最后交付的是一份10页的PPTX,全屏图片版式,简笔火柴人穿线,内容页底下都压了一句takeaway。上面那张十页总览里,「预训练给智商,微调给格式,对齐给人品」这句就压在第5页(从上数第三行、左边那张)底下。

效果比我预期好很多,我当场又让它换了几套设计重做,就是前面那五套。同一个技能,你完全可以根据自己的审美,以及你偏好的风格进行选择。

测试2:提要求,让豆包新建skill

第一个拼的是审美,好不好看得我自己看,说到底还是个主观判断。第二个我想要一个能客观评分的,图标切歪了就是切歪了,背景没去干净就是没去干净,你一眼就能看出来,不用听我说好。

就是前面那套图标流程。豆包的工作任务模式正好把三样放在同一个地方:生图、读写本地文件、跑脚本,我那套流程缺的恰好就是这个。

所以我用「创建技能」把需求提给它,按那四步拆成了六个Step,从读项目列清单一直到交付报告,另外写死了几条:清单必须自己去代码里读,不许反过来问我;切完要逐张自检,不达标的重切;最后的报告不许把没达标的说成达标。

六个Step加边界,原样提给它

它做的第一件事是去找技能的初始化脚本和写法参考,读完才开始动手,没有上来就写。真正让我有点意外的是后面这一段:写完主文件之后它没有交差,而是自己合成了一张网格图来测切图脚本,还补了两个失败场景的用例,中间Pillow没装,它自己装了再测。测出来的问题也挺有意思,先是白底残留漏检了,修完立刻反过来误报,一个漏检一个误报,两轮才收敛。

测试用例是它自己造的,漏洞是它自己发现的,动手修的那两轮也是它自己干的。

写在最后

以前这套图标流程要跨两个工具,我把图从一头搬到另一头,写出来的东西只能是教程,教你走一遍,交付不了你。现在同一套流程装进一个技能,在豆包工作任务模式里一句话跑完。

2月我那篇文章里写的「两者配合,才能形成完整的工作流」,现在可以改了。

不过跑完这一趟我想补的其实是另一句:技能这个东西,搬家是真挺简单的。

就像人一样,不管你是在哪家公司积累的skill,那都会成为你可以带着的东西,让你进入下一个公司时可以安装即用。虽然在不同的harness下,这套skill的价值可能不同。

顺带一提,我跟豆包已经聊了不算短的时间,工作、闲聊都在同一个地方攒着,这点零零散散的记忆沉淀下来,它慢慢也就更懂我在意什么、习惯怎么表达了——这个不是这次两个技能带来的,但确实是这次感受更明显的一层。

所以我现在有个新习惯,跑顺的流程就写成技能存着,把自己蒸馏成skill的事正在我身上不断发生。

一个做PPT,一个做成套图标,两个技能都在这儿免费开源了:

  • PPT那个:github.com/alchaincyf/huashu-slide-doubao
  • 图标那个:github.com/alchaincyf/huashu-icon-set

装的过程本身也不用你动手,把仓库地址丢给它,它自己会去clone、读README、装依赖,装完跑一遍告诉你能用了没有。

这张是我在「云电脑」那边试的,装的是我另一个开源技能,流程是一样的

有一个细节说明:这两个技能都依赖豆包内置的生图能力,离开这个环境跑不通。

都看到这了,去试试吧~自己动手干一次比读我10篇文章更有用。

本文由作者@花叔,授权发布于平台,未经许可禁止转载。

行业动态

手把手教你用WorkBuddy做一个「能发布」的个人网站

2026-8-21 11:33:59

行业动态

为压进我十年设计经验的 PPT Skill 更新了演讲者视图

2026-8-21 22:12:16

0 条回复 A文章作者 M管理员
    暂无讨论,说说你的看法吧