“牛模”多模态首试:拓!支持Skill、Cli【已免费开源】

这篇文章将分享,我自己开发并开源的巨好用的(我天天在用)AI原生截图工具。以及我智谱最新模型glm-5.3-flash的开发过程(希望能给你一点启发),包含如何把它一键接入codex使用,可以说用起来非常丝滑~。

这期干货满满,建议收藏!然后你可以把你使用的截图工具,和模型都换一换了😄。

大家好,我是袋鼠帝

作为一个AI博主,截图工具是我每天最高频使用的工具之一(我相信也是大部分人每天都会用到的工具)。

但是用了一圈下来,我发现好像没有一款免费开源的截图工具能够满足我所有的需求。

我之前一直用的是Snipaste,但是我感觉它越来越不够用,很多时候我得单独去找其他工具。

“牛模”多模态首试:拓!支持Skill、Cli【已免费开源】

甚至AI都已经出来这么久了,好像我还没有听说有哪一款截图工具是深度集成了AI能力的。

于是想要的功能我自己造~,猛猛肝,开发了一款AI原生的截图工具。

支持作为skill、cli接入任何agent使用。还融合了很多AI功能,你可以接入任何你想接入的大模型。可能是目前最好用的AI截图工具。

它叫拓(Ta),目前已经在Github免费开源!(如果觉得有用,记得帮忙点个Star哦~)

https://github.com/kangarooking/Ta

“牛模”多模态首试:拓!支持Skill、Cli【已免费开源】

页面大概长这样:

“牛模”多模态首试:拓!支持Skill、Cli【已免费开源】

“牛模”多模态首试:拓!支持Skill、Cli【已免费开源】

首先,常规截图工具该有的功能它都有了:

比如钉图、截图标注、打马赛克、写字、截长图(支持App和浏览器)、画箭头、标注1、2、3、4的步骤

“牛模”多模态首试:拓!支持Skill、Cli【已免费开源】

“牛模”多模态首试:拓!支持Skill、Cli【已免费开源】

既然叫AI原生截图工具,肯定是融入了AI能力的。

比如可以极速识别内容,框选后自动把图片中的文字复制到粘贴板。非常方便快捷。

还有框选后翻译,并把翻译内容自动复制到粘贴板。就更方便了

“牛模”多模态首试:拓!支持Skill、Cli【已免费开源】

以前的做法是截完图,我还要打开一个 AI,比如豆包把截图丢给它识别,识别的过程又要等个至少5秒以上。

然后比如说翻译,就算能选中文字,一般还要打开谷歌翻译粘贴进去,再翻译。总之整个链路都很长。反正我之前是这样处理的,不知道你们是怎么弄的。

但是现在用拓的话,一个快捷键+框选,然后就能直接获取到图片中的文字,甚至是翻译后的文字。

整个过程在3秒左右就能完成,贼快~

别小看节约的这点时间,如果你每天都要搞好多次,那一年算下来肯定能省下不少时间了。又可以多摸一下鱼啦。

然后,有些没有文字的内容,可以使用AI识图。比如说架构图,流程图,还有一些图案等等。

“牛模”多模态首试:拓!支持Skill、Cli【已免费开源】

除了识图,这里还预留了AI美化的功能,我的想法是,可以截图之后进行图片美化。

比如加高级感的边框,或者变黑白,增加锐度,或者P图等等(这块还在构思中,也欢迎大家在评论区,或者github多提提建议)。总之就是各种图片处理的功能。

其实最🐂🍺 的是把拓接入agent使用!

比如把ta-cli接入codex,只需要一条指令:

“牛模”多模态首试:拓!支持Skill、Cli【已免费开源】

然后codex就可以用它来帮我写一些教程类的文档,关键是截图里面它能帮我自动标注重点。

接下来我们介绍一下本次开发所使用的模型:智谱昨天刚刚开源的glm-5.3-flash。

它其实就是前几天网上爆火的匿名牛来模型~

作为智谱的老朋友,我也有幸获得了内测资格,正好用它来开发我想做的产品,顺便测试,一举两得😄~ 关键内测,不用花钱😁(不过glm-5.3-flash本身已经非常便宜,待会儿会讲)

最牛的是,它在openrouter拿下本周的调用量第一,超过第二名的DeepSeek2倍还多,这足以说明glm-5.3-flash的受欢迎程度了。

“牛模”多模态首试:拓!支持Skill、Cli【已免费开源】

同时,我想说,终于!!智谱这次给他们最新模型装上眼睛了。glm-5.3-flash支持多模态,同时支持1M上下文。

而且有超强的coding和agent能力,有多强呢?

先看下图的跑分(我的使用体感跟这个分数差不多,大概是Opus 4.8的水平。):

“牛模”多模态首试:拓!支持Skill、Cli【已免费开源】

关键glm-5.3-flash参数量不大,只有320B

而且价格相当感人!是Opus 4.8的1/40,是GLM-5.3的1/10,如果加上限时折扣,是GLM-5.3的1/20。可以说性价比炸裂!

“牛模”多模态首试:拓!支持Skill、Cli【已免费开源】

至此一条新斩杀线正在形成,前沿模型真正进入普惠时代!

“牛模”多模态首试:拓!支持Skill、Cli【已免费开源】

并且,glm-5.3-flash这次采用了全新的架构,做预训练:

在GLM-5的基础上进行了多项架构升级,是首个采用稀疏注意力与线性注意力混合架构的开源前沿模型,在保持精准长上下文能力的同时,还大幅降低了长上下文服务成本。

GLM-5.3-Flash还采用“流形约束超连接”(Manifold-Constrained Hyper-Connections,mHC),进一步提升了模型的scaling能力。

篇幅原因具体细节大家可以去看看技术报告。这里就不展开了。

“牛模”多模态首试:拓!支持Skill、Cli【已免费开源】

值得一提的是,过去一周,glm-5.3-flash都是在国产卡上面对外提供服务的,也是国产卡首次大规模集体出海练兵(在openrouter和opencode上面都创记录了)。

看得出来,我们正在慢慢突破美国对我们的GPU封锁。

glm-5.3-flash一键接入Codex

我用glm-5.3-flash照着之前DeepSeek的接入codex的脚本,开发了一个新脚本:专门用于把智谱模型一键接入codex。

bash <(curl -fsSL https://raw.githubusercontent.com/kangarooking/codex-doc/main/scripts/codex-zhipu-switch.sh)

“牛模”多模态首试:拓!支持Skill、Cli【已免费开源】

亲测好用,而且接入后的体验非常丝滑,光看这个界面,根本都看不出切换了模型。

“牛模”多模态首试:拓!支持Skill、Cli【已免费开源】

想要切换回原来的配置,在Mac上,只需要重复执行一次这个脚本即可:

“牛模”多模态首试:拓!支持Skill、Cli【已免费开源】

开发过程

这个项目本身细节还挺多的,任何模型都不可能一次性做完,我也是不断迭代了很多个版本。

所以接下来我挑一些重点回顾一下。

一开始我是用微信输入法,长按fn,口喷了一下我初步的想法,和需求。

“牛模”多模态首试:拓!支持Skill、Cli【已免费开源】

然后丢给Codex+glm-5.3-flash,跟它一起梳理出了一套方案。非常详细,直接干到了1400多行!

“牛模”多模态首试:拓!支持Skill、Cli【已免费开源】

有了需求、方案文档就让glm-5.3-flash开干啦

“牛模”多模态首试:拓!支持Skill、Cli【已免费开源】

后面,就是提问题,修复,提功能,优化。不断的重复。

然后过程中会诞生一些新的想法,比如要支持skill和cli是做着做着想到的。

glm-5.3-flash给我的感觉是又稳,又快。而且能力非常强,不管是coding还是agent,真的像它们榜单上那样能打,不是虚的。

最舒服的还是支持视觉理解后,它会自己打开拓,然后去操作,去获取报错信息。全自动的感觉真好!

glm-5.3-flash视觉能力确实不错,毕竟智谱其实去年一早就有视觉理解能力很强的模型了。

包括glm-5.3-flash的前端审美也不错,拓的UI虽然算不上顶级,但是现阶段我还挺满意的。

体验下来,我感觉glm-5.3-flash是一款六边形战士搬的大模型,并且每一边都不弱。

可以说是目前性价比最高的模型了,推荐大家在拓里面使用glm-5.3-flash~

“牛模”多模态首试:拓!支持Skill、Cli【已免费开源】

提示一下,拓目前还没有 GitHub 分发所需要的 Developer ID Application 签名、公证并装订票据。

所以目前要使用的话,需要在设置->隐私与安全性这里选择「仍要打开」。

“牛模”多模态首试:拓!支持Skill、Cli【已免费开源】

「最后」

之前都在说,kimi的K3出来之后,智谱要被压一头了。

不过K3一直被诟病,速度慢,又太贵。

智谱这款glm-5.3-flash是一记漂亮的回击,glm-5.3-flash不仅在能力上跟K3有的一拼,而且作为flash模型速度更快,价格还超便宜。是真正的把前沿模型打入了普惠时代。

然后我发现最近流行flash模型啊,继DeepSeek V4 flash模型之后,智谱也推出了超强的flash模型。

关键它们都一定程度上打破了模型的不可能三角:兼具速度、价格、性能。

这肯定是趋势,毕竟大家喜欢用能力强的模型,如果那个模型速度快的话就更好了,如果那个模型还便宜,那简直就是可以闭眼选了。

因为这样的模型,才能给普通人真正带来生产力~

我是袋鼠帝,一个致力于帮你把AI变成真实生产力的博主。我们下期见。

本文由作者@袋鼠帝AI客栈,授权发布于平台,未经许可禁止转载。

行业动态

企业级 MultiAgent 的记忆系统:短期上下文与四层记忆架构实现

2026-8-27 11:32:15

AI情报

腾讯Hy3 preview发布并开源:混元重建后首个模型,Agent能力大幅提升

2026-4-23 18:05:45

0 条回复 A文章作者 M管理员
    暂无讨论,说说你的看法吧