这篇文章将分享,我自己开发并开源的巨好用的(我天天在用)AI原生截图工具。以及我用智谱最新模型glm-5.3-flash的开发过程(希望能给你一点启发),包含如何把它一键接入codex使用,可以说用起来非常丝滑~。
这期干货满满,建议收藏!然后你可以把你使用的截图工具,和模型都换一换了😄。
大家好,我是袋鼠帝
作为一个AI博主,截图工具是我每天最高频使用的工具之一(我相信也是大部分人每天都会用到的工具)。
但是用了一圈下来,我发现好像没有一款免费开源的截图工具能够满足我所有的需求。
我之前一直用的是Snipaste,但是我感觉它越来越不够用,很多时候我得单独去找其他工具。

甚至AI都已经出来这么久了,好像我还没有听说有哪一款截图工具是深度集成了AI能力的。
于是想要的功能我自己造~,猛猛肝,开发了一款AI原生的截图工具。
支持作为skill、cli接入任何agent使用。还融合了很多AI功能,你可以接入任何你想接入的大模型。可能是目前最好用的AI截图工具。
它叫拓(Ta),目前已经在Github免费开源!(如果觉得有用,记得帮忙点个Star哦~)
https://github.com/kangarooking/Ta

页面大概长这样:


首先,常规截图工具该有的功能它都有了:
比如钉图、截图标注、打马赛克、写字、截长图(支持App和浏览器)、画箭头、标注1、2、3、4的步骤


既然叫AI原生截图工具,肯定是融入了AI能力的。
比如可以极速识别内容,框选后自动把图片中的文字复制到粘贴板。非常方便快捷。
还有框选后翻译,并把翻译内容自动复制到粘贴板。就更方便了

以前的做法是截完图,我还要打开一个 AI,比如豆包把截图丢给它识别,识别的过程又要等个至少5秒以上。
然后比如说翻译,就算能选中文字,一般还要打开谷歌翻译粘贴进去,再翻译。总之整个链路都很长。反正我之前是这样处理的,不知道你们是怎么弄的。
但是现在用拓的话,一个快捷键+框选,然后就能直接获取到图片中的文字,甚至是翻译后的文字。
整个过程在3秒左右就能完成,贼快~
别小看节约的这点时间,如果你每天都要搞好多次,那一年算下来肯定能省下不少时间了。又可以多摸一下鱼啦。
然后,有些没有文字的内容,可以使用AI识图。比如说架构图,流程图,还有一些图案等等。

除了识图,这里还预留了AI美化的功能,我的想法是,可以截图之后进行图片美化。
比如加高级感的边框,或者变黑白,增加锐度,或者P图等等(这块还在构思中,也欢迎大家在评论区,或者github多提提建议)。总之就是各种图片处理的功能。
其实最🐂🍺 的是把拓接入agent使用!
比如把ta-cli接入codex,只需要一条指令:

然后codex就可以用它来帮我写一些教程类的文档,关键是截图里面它能帮我自动标注重点。
接下来我们介绍一下本次开发所使用的模型:智谱昨天刚刚开源的glm-5.3-flash。
它其实就是前几天网上爆火的匿名牛来模型~
作为智谱的老朋友,我也有幸获得了内测资格,正好用它来开发我想做的产品,顺便测试,一举两得😄~ 关键内测,不用花钱😁(不过glm-5.3-flash本身已经非常便宜,待会儿会讲)
最牛的是,它在openrouter拿下本周的调用量第一,超过第二名的DeepSeek2倍还多,这足以说明glm-5.3-flash的受欢迎程度了。

同时,我想说,终于!!智谱这次给他们最新模型装上眼睛了。glm-5.3-flash支持多模态,同时支持1M上下文。
而且有超强的coding和agent能力,有多强呢?
先看下图的跑分(我的使用体感跟这个分数差不多,大概是Opus 4.8的水平。):

关键glm-5.3-flash参数量不大,只有320B。
而且价格相当感人!是Opus 4.8的1/40,是GLM-5.3的1/10,如果加上限时折扣,是GLM-5.3的1/20。可以说性价比炸裂!

至此一条新斩杀线正在形成,前沿模型真正进入普惠时代!

并且,glm-5.3-flash这次采用了全新的架构,做预训练:
在GLM-5的基础上进行了多项架构升级,是首个采用稀疏注意力与线性注意力混合架构的开源前沿模型,在保持精准长上下文能力的同时,还大幅降低了长上下文服务成本。
GLM-5.3-Flash还采用“流形约束超连接”(Manifold-Constrained Hyper-Connections,mHC),进一步提升了模型的scaling能力。
篇幅原因具体细节大家可以去看看技术报告。这里就不展开了。

值得一提的是,过去一周,glm-5.3-flash都是在国产卡上面对外提供服务的,也是国产卡首次大规模集体出海练兵(在openrouter和opencode上面都创记录了)。
看得出来,我们正在慢慢突破美国对我们的GPU封锁。
glm-5.3-flash一键接入Codex
我用glm-5.3-flash照着之前DeepSeek的接入codex的脚本,开发了一个新脚本:专门用于把智谱模型一键接入codex。
bash <(curl -fsSL https://raw.githubusercontent.com/kangarooking/codex-doc/main/scripts/codex-zhipu-switch.sh)

亲测好用,而且接入后的体验非常丝滑,光看这个界面,根本都看不出切换了模型。

想要切换回原来的配置,在Mac上,只需要重复执行一次这个脚本即可:

开发过程
这个项目本身细节还挺多的,任何模型都不可能一次性做完,我也是不断迭代了很多个版本。
所以接下来我挑一些重点回顾一下。
一开始我是用微信输入法,长按fn,口喷了一下我初步的想法,和需求。

然后丢给Codex+glm-5.3-flash,跟它一起梳理出了一套方案。非常详细,直接干到了1400多行!

有了需求、方案文档就让glm-5.3-flash开干啦

后面,就是提问题,修复,提功能,优化。不断的重复。
然后过程中会诞生一些新的想法,比如要支持skill和cli是做着做着想到的。
glm-5.3-flash给我的感觉是又稳,又快。而且能力非常强,不管是coding还是agent,真的像它们榜单上那样能打,不是虚的。
最舒服的还是支持视觉理解后,它会自己打开拓,然后去操作,去获取报错信息。全自动的感觉真好!
glm-5.3-flash视觉能力确实不错,毕竟智谱其实去年一早就有视觉理解能力很强的模型了。
包括glm-5.3-flash的前端审美也不错,拓的UI虽然算不上顶级,但是现阶段我还挺满意的。
体验下来,我感觉glm-5.3-flash是一款六边形战士搬的大模型,并且每一边都不弱。
可以说是目前性价比最高的模型了,推荐大家在拓里面使用glm-5.3-flash~

提示一下,拓目前还没有 GitHub 分发所需要的 Developer ID Application 签名、公证并装订票据。
所以目前要使用的话,需要在设置->隐私与安全性这里选择「仍要打开」。

「最后」
之前都在说,kimi的K3出来之后,智谱要被压一头了。
不过K3一直被诟病,速度慢,又太贵。
智谱这款glm-5.3-flash是一记漂亮的回击,glm-5.3-flash不仅在能力上跟K3有的一拼,而且作为flash模型速度更快,价格还超便宜。是真正的把前沿模型打入了普惠时代。
然后我发现最近流行flash模型啊,继DeepSeek V4 flash模型之后,智谱也推出了超强的flash模型。
关键它们都一定程度上打破了模型的不可能三角:兼具速度、价格、性能。
这肯定是趋势,毕竟大家喜欢用能力强的模型,如果那个模型速度快的话就更好了,如果那个模型还便宜,那简直就是可以闭眼选了。
因为这样的模型,才能给普通人真正带来生产力~
我是袋鼠帝,一个致力于帮你把AI变成真实生产力的博主。我们下期见。
本文由作者@袋鼠帝AI客栈,授权发布于平台,未经许可禁止转载。
