通义万相是阿里巴巴推出的 AI 绘画平台,官方描述它为通义旗下的 AI 创意创作平台,目标是用人工智能降低创作门槛,把文生图、图生图、文生视频、图生视频、图像编辑这几类场景收进同一个入口。
这五类场景可以按输入和输出分成三组:文字生成图像、图像作为起点继续加工、以及视频方向。这篇文章按这个顺序逐块说明每类能力在做什么、适合什么需求,以及它的边界在哪里。
文字生成图像:文生图
文生图是最基础的一类:给一段文字描述,得到一张对应的画面。
它改变的是创作的起点。传统流程里,从想法到画面要经过构图、草稿、上色多个阶段,每一步都依赖手工技能。文生图把技能门槛替换成了表达能力——你需要把想要的画面说清楚,而不是画出来。
这也意味着文生图的瓶颈通常在输入端。描述里包含的要素越具体,出图越接近预期;只说「一张好看的图」,结果就只能靠模型自由发挥。行业里常见的经验是把主体、风格、构图、光线分开描述,比堆砌形容词更有效。
图像作为起点:图生图与图像编辑
文生图之外,官方描述还列出了图生图和图像编辑。这两类都以上传的图像作为输入,但目标不同。
图生图是在已有图像的基础上生成新画面。它适合的场景是「我想要类似的感觉,但换一个内容」。相比纯文字描述,给一张参考图能把风格、配色、构图这些难以言说的部分直接传递过去,减少来回试错。
图像编辑则更偏向修改:对现有画面做局部调整,而不是重新生成一张。这在实用场景里价值很高,因为很多时候你只是需要改一个细节,重新生成整张图反而会丢掉其他满意的部分。
这两类能力合起来,让工具从「一次性生成」变成了可以迭代加工的过程。
视频方向:文生视频与图生视频
官方描述里还包含文生视频和图生视频,这两个方向对应的是内容形态从静态向动态的延伸。
文生视频的逻辑和文生图类似,只是输出从单帧画面变成了一段动态内容。图生视频则是以一张图片作为起点,让它动起来——这条路径在实用上更常见,因为静态图更容易先确认效果,确认满意后再转成动态。
需要客观看待的是,视频生成在整个行业里都属于难度更高的方向。画面连续性、运动合理性、时长控制这些问题普遍存在,不是某一家产品独有的短板。官方描述列出的是能力范围,实际效果要按具体题材验证。
「降低创作门槛」具体降低了什么
官方描述把降低创作门槛作为平台目标,这句话可以从三个角度理解。
一是技能门槛。过去要产出视觉内容,需要掌握绘画或设计软件;现在需要的是把需求描述清楚的能力。
二是工具门槛。五类场景在同一个平台内完成,从静态到动态不必切换软件,素材也不必反复导出导入。
三是启动门槛。不需要先准备专业设备或素材库,一段文字或一张现成图片就可以开始。
门槛降低不等于专业能力被替代。它让更多人能产出可用内容,但在需要精确控制、严格规范的专业环节,仍然要依赖专业工具和经验。
边界与注意事项
有几件事需要自己判断。
官方描述没有涉及定价、额度限制和商用授权范围,这些属于使用前必须实际确认的部分,不能从描述推断。
涉及人物形象、品牌标识、版权素材的内容,使用前要确认授权与合规要求。这部分和工具能力无关,但决定了产出能不能真正投入使用。
小结
- 通义万相由阿里巴巴推出,官方定位为通义旗下的 AI 创意创作平台。
- 官方描述的目标是通过人工智能技术降低创作门槛。
- 能力覆盖文生图、图生图、文生视频、图生视频、图像编辑五类场景。
- 图生图与图像编辑让创作从一次性生成变成可迭代加工。
- 视频方向属于行业内公认的高难度环节,效果需按题材验证。
- 定价、额度与商用授权范围需实际确认,描述中未涉及。