文章摘要
ChatGPT Sites目前已开启公测,用户无需编写代码,仅通过自然语言提示或上传参考素材,十余分钟即可生成功能完备的交互式网站,还支持便捷修改,大幅降低建站门槛,给传统拖拽式建站SaaS行业带来冲击。此外,GPT-6跨模态测试显示,它可仅通过Mel频谱图完成高难度声音识别,突破了人类感官壁垒。

无需编写一行代码,仅通过自然语言提示或是上传手绘草图,就能在十余分钟内搭建出功能完备的专业交互式网站——ChatGPT Sites的公测,让建站门槛被彻底拉低。这一功能的推出,不仅重塑了个人和企业的建站体验,更让依赖拖拽式服务的传统建站SaaS行业面临前所未有的冲击。

从早期需要专业代码能力的前端开发,到各类拖拽式工具的普及,建站的便捷性一直在逐步提升。但ChatGPT Sites的出现,直接把这一赛道的竞争逻辑彻底改写。有行业实测反馈,制作美观网站的体验已经和创建在线文档一样简单。

目前该功能已面向多个版本的ChatGPT用户全面开放,其操作流程十分简洁:

1. 明确建站愿景:用简短的语言描述想要的网站类型、面向的受众群体等核心信息

2. 上传参考素材:如果有心仪的网页截图、手绘设计稿,可以直接上传作为创作参考

3. 提出功能需求:无论是链接按钮、嵌入式视觉效果还是复杂交互组件,都可以直接通过语言说明

4. 等待生成完成:根据网站复杂度,大约10到15分钟,一个完整的交互式网站就会生成

值得注意的是,这并非简单的模板套用,而是真正的沉浸式代码生成。不少早期测试者已经用它完成了多个优质项目:有人搭建了媒体套件赞助页面、现代化的城市活动指南,甚至是支持商品拖拽购物的野餐用品在线商店;艺术家还利用它开发了名为GoalFlow的艺术创作工具,用户选择国旗后,可以在流体模拟画布上用国旗色彩进行创作,颜料会像水中色素一样自然旋转漂移;还有开发者用它快速生成了带有真实物理效果的积木类游戏和纸飞机闯关小游戏。

更值得关注的是其强大的迭代修改能力。在生成初稿后,用户可以通过侧边栏的注释工具,直接在页面上标注修改需求,比如调整按钮颜色、更换字体或替换图片,AI可以无缝完成修改,无需重新从头生成。

尽管此前已有多款AI建站工具,相关UI交互工具也有不错表现,但ChatGPT Sites的核心优势在于其庞大的生态整合能力。当用户在ChatGPT项目中工作时,它可以自动读取品牌风格指南和logo库,生成的网站会自带品牌特色。这意味着,前端开发的角色已经被降维为提示词产品经理,而依赖拖拽建站收取高额月费的传统SaaS企业,如果不能快速转型,将面临巨大的生存压力。

跨模态能力突破:AI打破人类感官壁垒

除了建站领域的颠覆,近期公开的GPT-6跨模态测试结果,同样引发了行业的广泛关注。在未播放音频、完全断网的情况下,仅通过一张Mel频谱图,GPT-6就能准确识别出深海蓝鲸的叫声,甚至能认出《星球大战》里的光剑挥舞音效。测试过程中,研究者仅给出了“这个声音来自自然哺乳动物”的简单提示,GPT-6就准确判断出是蓝鲸。

这一结果远超大众的认知,因为蓝鲸的叫声属于极低频区间,和狮子、老虎、大象的叫声频段重叠,仅凭频谱图上的局部能量特征无法直接判定是蓝鲸。音频工程师分析认为,GPT-6捕捉到的是能量随时间持续变化的形态特征,它并非简单匹配图像特征,而是理解了声波在物理空间中随时间流动和衰减的规律。这是通用大模型首次在无专项微调的情况下,完成如此高难度的跨模态零样本推理。

另一位测试者的演示同样令人震撼,GPT-6可以直接从Mel频谱图中识别出非自然的光剑音效,测试者不禁感叹,我们目前只是触及了这项技术的皮毛。

摆脱生物束缚:AI的原生解码能力

人类的感知能力存在天然局限,我们需要通过耳朵接收空气振动才能感知声音,通过眼睛接收光线才能看到图像,这是数百万年进化形成的感官壁垒。早期的多模态AI本质上是在模仿人类的感知方式,比如给AI输入音频文件和图片,让它像人类一样去理解信息。

但GPT-6的能力意味着,大模型正在摆脱人类生物学器官的束缚。对于GPT-6来说,蓝鲸的鸣叫和光剑的撕裂声没有本质区别,它们都是物理世界的能量波动形式。当这些波动被转化为Mel频谱图这种数学几何表达时,GPT-6可以直接“阅读”物理规则本身,不需要依赖听觉器官就能理解声音的本质。

AI的多模态理解已经从模仿人类感官,进化到对物理世界数据结构的原生解码。今天它可以通过频谱图识别蓝鲸,未来如果输入地震波图像,或许可以预测断层破裂;输入脑电波图像,或许可以读取人类的思维。人类通过肉身感受宇宙的投影,而AI正在直接阅读宇宙的源代码。

以上内容不代表本平台立场,仅供读者参考