文章摘要
AI领域开发者因现有截图工具无法满足AI时代需求,自主开发出名为“拓(Ta)”的开源AI原生截图工具,已上传至GitHub开源。该工具覆盖全部常规截图功能,集成极速文字识别、实时翻译、AI识图等AI能力,可一键接入codex等agent,核心采用智谱高性能高性价比多模态大模型glm-5.3-flash,作者分享了开发与接入方法,推荐用户试用。

经过三天的开发,我开源了一款AI原生截图工具,如果你对当前使用的截图软件不满意,这款工具或许能满足你的需求。

本文将详细介绍这款我日常使用的开源AI截图工具,同时分享使用最新多模态模型开发这款工具的完整过程,还会讲解如何将工具一键接入codex,整体使用体验十分流畅。

本文干货较多,建议收藏,不妨将你常用的截图工具和AI模型替换为这款工具和对应模型试试。

作为一名专注AI领域的创作者,截图工具是我每日高频使用的工具之一,相信大多数用户也是如此。但我在试用了多款工具后发现,几乎没有免费开源的截图工具能完全满足我的需求。此前我一直在使用Snipaste,但随着使用频率增加,它的功能逐渐无法适配我的使用场景,很多时候需要额外搭配其他工具才能完成工作。更何况在AI技术普及的当下,几乎没有一款截图工具能够深度集成AI能力,这让我萌生了自己开发一款工具的想法。

于是我决定自主开发,经过数日打磨,终于完成了这款AI原生截图工具。它不仅支持作为skill、cli接入任意agent,还集成了丰富的AI功能,你可以自由接入任何想要使用的大模型,或许是目前体验最佳的AI截图工具之一。这款工具名为“拓(Ta)”,目前已经在GitHub开源,如果觉得好用,欢迎给项目点Star支持。

项目地址:https://github.com/kangarooking/Ta

工具的界面风格简洁实用,基础功能涵盖了钉图、标注、打码、文字编辑、长截图(支持APP和浏览器场景)、箭头绘制、步骤标注等常规截图工具的所有功能。

作为AI原生截图工具,它的核心优势在于集成了多项AI能力:

首先是极速文字识别,框选截图区域后可以自动提取图片中的文字并复制到剪贴板,无需额外操作。

其次是实时翻译功能,框选截图后可以直接获取翻译结果并复制,省去了打开第三方翻译工具的步骤。

过去我处理这类工作的流程是:截图完成后打开AI工具上传图片等待识别,至少需要5秒以上;如果需要翻译,还要手动复制文字到翻译平台,整个流程繁琐且耗时。而使用这款工具后,只需按下快捷键框选区域,就能在3秒内完成文字提取或翻译,大幅提升了工作效率。日积月累下来,能节省的时间相当可观。

除了文字类内容的处理,工具还支持AI识图功能,可以识别架构图、流程图、图案等无文字的图片内容。同时还预留了AI图片美化功能,后续可以实现添加高级边框、黑白转换、锐化调整、图片修图等功能,目前该功能还在迭代中,欢迎大家通过评论区或GitHub提交建议。

这款工具最强大的功能之一,是可以轻松接入agent使用。以接入codex为例,只需执行一条简单的命令即可完成配置:

bash <(curl -fsSL https://raw.githubusercontent.com/kangarooking/codex-doc/main/scripts/codex-zhipu-switch.sh)

配置完成后,codex就可以使用这款工具辅助生成教程类文档,还能自动对截图内容进行重点标注,进一步提升文档产出效率。

本次开发使用的核心模型是智谱最新推出的glm-5.3-flash,也就是此前网上爆火的匿名大模型。作为智谱的早期内测用户,我有幸抢先体验了这款模型,并将其用于这款工具的开发和测试,一举两得。更重要的是,内测期间无需付费,即便在正式使用,glm-5.3-flash的价格也十分亲民。

这款模型在OpenRouter平台的本周调用量排名第一,甚至超过第二名DeepSeek的两倍,足以证明其市场受欢迎程度。

值得一提的是,glm-5.3-flash首次支持多模态能力,同时拥有1M上下文窗口,coding和agent能力都十分强劲。从实测跑分来看,其性能大致相当于Opus 4.8的水平,和我的实际使用体感一致。

这款模型参数量仅为320B,但其性能却十分强劲,价格却十分亲民:其售价仅为Opus 4.8的1/40,是GLM-5.3的1/10,如果参与限时折扣活动,价格仅为GLM-5.3的1/20,性价比极高。这也标志着前沿AI模型正式进入普惠时代。

在架构方面,glm-5.3-flash基于GLM-5进行了多项升级,是首个采用稀疏注意力与线性注意力混合架构的开源前沿模型,在保留精准长上下文处理能力的同时,大幅降低了长上下文服务的成本。此外,模型还采用了“流形约束超连接”技术,进一步提升了模型的扩展能力。由于篇幅限制,具体的技术细节不再展开,感兴趣的读者可以查阅官方技术报告了解更多内容。

值得关注的是,在过去一周,glm-5.3-flash基于国产加速卡对外提供服务,这也是国产加速卡首次大规模集体出海服务,在OpenRouter和OpenCode平台都创下了相关记录,这标志着我们在GPU技术封锁的突破上迈出了重要一步。

glm-5.3-flash一键接入Codex的方法

我参考此前DeepSeek的codex接入脚本,使用glm-5.3-flash开发了专属的一键配置脚本,可以快速将智谱模型接入codex。

经过实测,这套配置方案体验十分流畅,从界面上几乎看不出模型已经切换。

如果需要切换回原有配置,在Mac系统下只需再次执行该脚本即可完成。

工具开发过程

这款工具的开发细节较多,没有任何一款产品可以一蹴而就,我经过了多个版本的迭代打磨才完成最终的版本。接下来我将重点回顾开发过程中的关键节点。

开发初期,我通过输入法整理了初步的需求和想法,随后将这些内容交给Codex和glm-5.3-flash协作梳理,最终生成了一份超过1400行的详细开发方案。

基于这份需求和方案文档,我使用glm-5.3-flash辅助完成了核心代码的开发。

后续的开发过程就是不断提出问题、修复bug、新增功能、优化体验,循环迭代。在这个过程中也诞生了不少新的想法,比如支持skill和cli功能就是在开发过程中逐渐完善的。

glm-5.3-flash给我的使用感受十分出色,运行稳定且速度快,无论是代码开发还是agent任务处理,能力都十分强劲,和榜单上的表现一致,并非虚标。

最令人惊喜的是,模型支持视觉理解后,可以自动启动工具进行操作,甚至自动获取报错信息,全自动化的操作体验大幅提升了开发效率。

glm-5.3-flash的视觉理解能力十分出色,毕竟智谱在去年就已经推出了视觉能力强劲的模型,技术积累十分深厚。

此外,glm-5.3-flash在前端设计方面的表现也可圈可点,“拓”工具的UI虽然算不上顶级水准,但在当前阶段已经完全满足我的使用需求。

综合体验来看,glm-5.3-flash是一款全能型的大模型,各方面性能都十分均衡,是目前性价比最高的大模型之一,强烈推荐大家在“拓”工具中使用这款模型。

需要注意的是,“拓”工具目前还没有GitHub分发所需的Developer ID Application签名,因此在Mac系统中使用时,需要在系统设置的隐私与安全性页面中选择“仍要打开”才能正常运行。

最后

此前业内普遍认为,Kimi的K3推出后会对智谱的市场地位造成冲击,但K3一直被诟病速度慢、价格高。而glm-5.3-flash的推出,可以说是智谱的一次漂亮回击:其性能与K3不相上下,同时作为Flash模型拥有更快的运行速度,价格更是极具竞争力,真正将前沿AI模型带入了普惠时代。

近期Flash模型成为行业热门方向,在DeepSeek推出V4 Flash模型之后,智谱也推出了这款高性能的Flash模型。这类模型在一定程度上打破了AI模型的“不可能三角”,实现了速度、价格和性能三者的平衡。这无疑是行业的重要发展趋势:用户都希望使用性能强劲的模型,如果同时拥有更快的速度和更低的价格,无疑是最优选择。这类模型能够真正为普通用户带来实实在在的生产力提升。

谢谢你耐心看完我的文章~

以上内容不代表本平台立场,仅供读者参考