你的截图工具该换了!开源AI原生神器集成glm-5.3-flash

经过三天的开发,我开源了一款AI原生截图工具,如果你对当前使用的截图软件不满意,这款工具或许能满足你的需求。
本文将详细介绍这款我日常使用的开源AI截图工具,同时分享使用最新多模态模型开发这款工具的完整过程,还会讲解如何将工具一键接入codex,整体使用体验十分流畅。
本文干货较多,建议收藏,不妨将你常用的截图工具和AI模型替换为这款工具和对应模型试试。
作为一名专注AI领域的创作者,截图工具是我每日高频使用的工具之一,相信大多数用户也是如此。但我在试用了多款工具后发现,几乎没有免费开源的截图工具能完全满足我的需求。此前我一直在使用Snipaste,但随着使用频率增加,它的功能逐渐无法适配我的使用场景,很多时候需要额外搭配其他工具才能完成工作。更何况在AI技术普及的当下,几乎没有一款截图工具能够深度集成AI能力,这让我萌生了自己开发一款工具的想法。
于是我决定自主开发,经过数日打磨,终于完成了这款AI原生截图工具。它不仅支持作为skill、cli接入任意agent,还集成了丰富的AI功能,你可以自由接入任何想要使用的大模型,或许是目前体验最佳的AI截图工具之一。这款工具名为“拓(Ta)”,目前已经在GitHub开源,如果觉得好用,欢迎给项目点Star支持。
项目地址:https://github.com/kangarooking/Ta
工具的界面风格简洁实用,基础功能涵盖了钉图、标注、打码、文字编辑、长截图(支持APP和浏览器场景)、箭头绘制、步骤标注等常规截图工具的所有功能。
作为AI原生截图工具,它的核心优势在于集成了多项AI能力:
首先是极速文字识别,框选截图区域后可以自动提取图片中的文字并复制到剪贴板,无需额外操作。
其次是实时翻译功能,框选截图后可以直接获取翻译结果并复制,省去了打开第三方翻译工具的步骤。
过去我处理这类工作的流程是:截图完成后打开AI工具上传图片等待识别,至少需要5秒以上;如果需要翻译,还要手动复制文字到翻译平台,整个流程繁琐且耗时。而使用这款工具后,只需按下快捷键框选区域,就能在3秒内完成文字提取或翻译,大幅提升了工作效率。日积月累下来,能节省的时间相当可观。
除了文字类内容的处理,工具还支持AI识图功能,可以识别架构图、流程图、图案等无文字的图片内容。同时还预留了AI图片美化功能,后续可以实现添加高级边框、黑白转换、锐化调整、图片修图等功能,目前该功能还在迭代中,欢迎大家通过评论区或GitHub提交建议。
这款工具最强大的功能之一,是可以轻松接入agent使用。以接入codex为例,只需执行一条简单的命令即可完成配置:
bash <(curl -fsSL https://raw.githubusercontent.com/kangarooking/codex-doc/main/scripts/codex-zhipu-switch.sh)
配置完成后,codex就可以使用这款工具辅助生成教程类文档,还能自动对截图内容进行重点标注,进一步提升文档产出效率。
本次开发使用的核心模型是智谱最新推出的glm-5.3-flash,也就是此前网上爆火的匿名大模型。作为智谱的早期内测用户,我有幸抢先体验了这款模型,并将其用于这款工具的开发和测试,一举两得。更重要的是,内测期间无需付费,即便在正式使用,glm-5.3-flash的价格也十分亲民。
这款模型在OpenRouter平台的本周调用量排名第一,甚至超过第二名DeepSeek的两倍,足以证明其市场受欢迎程度。
值得一提的是,glm-5.3-flash首次支持多模态能力,同时拥有1M上下文窗口,coding和agent能力都十分强劲。从实测跑分来看,其性能大致相当于Opus 4.8的水平,和我的实际使用体感一致。
这款模型参数量仅为320B,但其性能却十分强劲,价格却十分亲民:其售价仅为Opus 4.8的1/40,是GLM-5.3的1/10,如果参与限时折扣活动,价格仅为GLM-5.3的1/20,性价比极高。这也标志着前沿AI模型正式进入普惠时代。
在架构方面,glm-5.3-flash基于GLM-5进行了多项升级,是首个采用稀疏注意力与线性注意力混合架构的开源前沿模型,在保留精准长上下文处理能力的同时,大幅降低了长上下文服务的成本。此外,模型还采用了“流形约束超连接”技术,进一步提升了模型的扩展能力。由于篇幅限制,具体的技术细节不再展开,感兴趣的读者可以查阅官方技术报告了解更多内容。
值得关注的是,在过去一周,glm-5.3-flash基于国产加速卡对外提供服务,这也是国产加速卡首次大规模集体出海服务,在OpenRouter和OpenCode平台都创下了相关记录,这标志着我们在GPU技术封锁的突破上迈出了重要一步。
glm-5.3-flash一键接入Codex的方法
我参考此前DeepSeek的codex接入脚本,使用glm-5.3-flash开发了专属的一键配置脚本,可以快速将智谱模型接入codex。
经过实测,这套配置方案体验十分流畅,从界面上几乎看不出模型已经切换。
如果需要切换回原有配置,在Mac系统下只需再次执行该脚本即可完成。
工具开发过程
这款工具的开发细节较多,没有任何一款产品可以一蹴而就,我经过了多个版本的迭代打磨才完成最终的版本。接下来我将重点回顾开发过程中的关键节点。
开发初期,我通过输入法整理了初步的需求和想法,随后将这些内容交给Codex和glm-5.3-flash协作梳理,最终生成了一份超过1400行的详细开发方案。
基于这份需求和方案文档,我使用glm-5.3-flash辅助完成了核心代码的开发。
后续的开发过程就是不断提出问题、修复bug、新增功能、优化体验,循环迭代。在这个过程中也诞生了不少新的想法,比如支持skill和cli功能就是在开发过程中逐渐完善的。
glm-5.3-flash给我的使用感受十分出色,运行稳定且速度快,无论是代码开发还是agent任务处理,能力都十分强劲,和榜单上的表现一致,并非虚标。
最令人惊喜的是,模型支持视觉理解后,可以自动启动工具进行操作,甚至自动获取报错信息,全自动化的操作体验大幅提升了开发效率。
glm-5.3-flash的视觉理解能力十分出色,毕竟智谱在去年就已经推出了视觉能力强劲的模型,技术积累十分深厚。
此外,glm-5.3-flash在前端设计方面的表现也可圈可点,“拓”工具的UI虽然算不上顶级水准,但在当前阶段已经完全满足我的使用需求。
综合体验来看,glm-5.3-flash是一款全能型的大模型,各方面性能都十分均衡,是目前性价比最高的大模型之一,强烈推荐大家在“拓”工具中使用这款模型。
需要注意的是,“拓”工具目前还没有GitHub分发所需的Developer ID Application签名,因此在Mac系统中使用时,需要在系统设置的隐私与安全性页面中选择“仍要打开”才能正常运行。
最后
此前业内普遍认为,Kimi的K3推出后会对智谱的市场地位造成冲击,但K3一直被诟病速度慢、价格高。而glm-5.3-flash的推出,可以说是智谱的一次漂亮回击:其性能与K3不相上下,同时作为Flash模型拥有更快的运行速度,价格更是极具竞争力,真正将前沿AI模型带入了普惠时代。
近期Flash模型成为行业热门方向,在DeepSeek推出V4 Flash模型之后,智谱也推出了这款高性能的Flash模型。这类模型在一定程度上打破了AI模型的“不可能三角”,实现了速度、价格和性能三者的平衡。这无疑是行业的重要发展趋势:用户都希望使用性能强劲的模型,如果同时拥有更快的速度和更低的价格,无疑是最优选择。这类模型能够真正为普通用户带来实实在在的生产力提升。
谢谢你耐心看完我的文章~

