AI生图终于能把字写对了!近日,智谱联合华为正式开源新一代图像生成模型GLM-Image,不仅攻克了行业长期困扰的“识文难、写对更难”痛点,API调用一张图仅需0.1元,价格更是低至海外同类产品的1/10到1/3,堪称国产AI生图领域的一次重要突破。 了解AI生图的人都知道,以往用AI做海报、插画,画面美感可能没问题,但文字部分总能让人抓狂——要么笔画缺胳膊少腿,要么字形歪歪扭扭像“火星文”,根本没法满足实际使用需求。而GLM-Image最核心的优势,就是把这个难题解决了。 《科创板日报》记者专门做了实测,验证它的文字理解和生成能力。只输入一句“用橙色和白色生成爱马仕商业海报”,模型很快就输出了符合要求的视觉效果;再试“用千与千寻的一句经典台词生成社交媒体封面”这种简洁指令,也能精准get需求并完成生成。除了海报、社交媒体封面,像AI手抄报、科普图这类排版复杂或知识密集型的图文需求,它都能轻松应对。 这背后离不开GLM-Image创新的技术架构。据智谱方面介绍,模型采用了“自回归+扩散编码器”的混合设计,简单说就是靠9B参数的自回归模型负责理解复杂指令、把握全局,7B参数的扩散解码器负责刻画细腻像素,中间还专门加了个Glyph Encoder模块专攻文字生成,这套“组合拳”让它在文字渲染任务上表现格外突出,不仅在CVTG-2K(复杂视觉文本生成)和LongText-Bench(长文本渲染)两大权威榜单拿下开源第一,对汉字生成的适配度也特别高。更厉害的是,它还能自适应处理多种分辨率,从1024x1024到2048×2048的任意比例图像都能生成,不用重新训练。 值得一提的是,GLM-Image是首个在国产芯片上完成全程训练的SOTA级多模态模型。它基于华为昇腾Atlas 800T A2设备和昇思MindSpore AI框架,打通了从数据预处理到大规模训练的全流程,彻底摆脱了对海外算力芯片的依赖。智谱相关负责人表示,这是面向认知型生成技术范式的一次重要探索,作为首个开源的工业表现级离散自回归图像生成模型,希望能和开源社区分享技术路径与实践思考。 在大模型领域业内人士看来,这次合作的意义远超单个模型的突破。以往都是“模型迁就芯片”,而GLM-Image在算法设计阶段就充分考虑了昇腾芯片的架构特点,把芯片算力利用率拉满,这不仅验证了国产芯片能支撑前沿多模态模型训练,更提供了从“芯片适配模型”向“模型定义芯片”转型的范本。昇腾芯片的算力和稳定性也通过这次合作得到充分验证,能给更多企业选择国产算力的信心,降低关键技术被“卡脖子”的风险。 0.1元/张的API调用价,更是让GLM-Image的商业化门槛低到极致。要知道,海外主流闭源模型比如GPT-Image、Nano Banana,一张图的调用价折合人民币要0.28元到1.2元。而且GLM-Image开源可商用,不用额外付授权费,再加上智谱提供的轻量化部署方案,普通消费级GPU就能运行,中小企业想用上先进的多模态AI能力,再也不用被高成本拦住了。 低成本的背后,是全链条国产化技术栈的支撑。从硬件层的昇腾芯片,到框架层的MindSpore,再到模型层的GLM-Image,每一环都实现自主可控,大幅降低了技术授权和供应链成本,这也是国产AI生态建设进入新阶段的重要标志。 GLM-Image的发布,也让2026年初的国产大模型赛道更显热闹。就在1月14日,MiniMax正式开源了OctoCodingBench,这是国内首个面向Coding Agent的系统性评测集;1月12日,DeepSeek联合北大发布大模型论文,首创“条件记忆”概念,直击大模型记忆力短板,开辟了大模型稀疏性技术的新维度。不难看出,国产AI正在各个细分领域加速突破,形成多点开花的态势。