admin 发表于 2026-7-21 11:26:33

课程对于图片和视频模型的总结:

图像生成模型排名综合能力,参考2026年主流评测

Google Imagen 4(提示词遵循与细节最佳)

Midjourney V8(艺术性与审美领先)

OpenAI GPT image-2(复杂场景与文本渲染强)

Black Forest Labs FLUX 2(开源生态灵活,质量接近顶配)

字节跳动 Seedream 5.0 Pro(豆包/即梦使用,中文理解优)

阿里 Qwen-Image-3.0(文本与图表生成突出)

阿里 Z-Image(速度极快,开源)

智谱 GLM-Image(混合架构,文本渲染好)

腾讯 HunyuanImage-3.0(有轻量部署版本)

Google Gemini 3.5(全能型,但图像生成略逊于专用模型)

Stability AI Stable Diffusion 3.5(经典,硬件友好)

视频生成模型排名(综合能力,含控制性、一致性、分辨率):

Google Veo 3.1(角色一致性与物理逻辑最佳)

快手可灵 Kling 3.0(复杂动作与日常交互顶级,支持4K)

Runway Gen-4(专业摄像机控制,精细区域控制)

OpenAI Sora(知名度高,但实际评测稍逊于前两者)

Luma Dream Machine Ray3(关键帧插值突出,适合转场)

字节跳动 Seedance 2.0/2.5(国内常用,效果稳定)

Pika 2.0(短视频平台友好)

页: [1]
查看完整版本: 课程对于图片和视频模型的总结: