2026 AI模型指南文本 • 图像 • 语音 • 视频
对比截至2026年9月的主流AI模型。快速查看Claude Fable 5.1、GPT-6 Astra、Gemini 3.8 Flash等模型的ID、价格边界与适用任务。
2026年AI模型分类
文本生成AI
面向复杂推理、编程和智能体任务的当前LLM,对比官方模型ID、上下文窗口、工具能力、API阶段与价格。
Claude Fable 5.1
高难度推理、长时间运行的智能体与多步骤研究;适合常规模型仍无法完成的任务。
核心特性
更新
2026-09
GPT-6 Astra
复杂编程、研究与文档任务;支持图像输入、工具调用和结构化输出。
核心特性
更新
2026-09
Gemini 3.8 Flash
兼顾成本的编程与多模态分析,接受文本、图像、视频、音频和 PDF,输出文本。
核心特性
图像生成AI
当前图像生成与编辑模型,覆盖复杂指令、文字排版、多参考图和生产级素材工作流。
GPT Image 2
图像生成与编辑,适合需要遵循详细指令和保留参考图特征的素材制作。
核心特性
定价
更新
2026-09
FLUX.2 Pro
多参考图生成与编辑,适合需要重复生产视觉素材的工作。
核心特性
更新
2026-09
Nano Banana Pro
复杂视觉指令、品牌一致性和精细设计;对应 Nano Banana Pro。
核心特性
定价
更新
2026-09
语音合成AI
当前实时语音与TTS模型,覆盖推理、工具调用、多模态上下文、打断处理和富有表现力的语音合成。
GPT-Realtime-2.1
可被打断的实时语音对话,支持推理与工具调用,适合客服和语音智能体。
核心特性
更新
2026-09
Gemini 3.1 Flash Live
低延迟音频对话与多模态交互,通过 Live API 接入。
核心特性
定价
更新
2026-09
Eleven v3
富有表现力的配音、角色对话与旁白,支持音频标签控制语气。
核心特性
定价
更新
2026-09
视频生成AI
当前视频生成与编辑模型,覆盖带音频短片、对话式修改、多模态参考和API工作流。
Gemini Omni 1.1 Flash
通过自然语言反复修改短视频,适合对话式生成和编辑。
核心特性
定价
更新
2026-09
Veo 3.1
需要同步音频和镜头控制的短片生成,可按制作要求选择 Standard、Fast 或 Lite。
核心特性
定价
更新
2026-09
Seedance 2.5
最长 30 秒的音视频联合生成,支持参考素材控制、视频延长与精细编辑。
核心特性
定价
更新
2026-09
这份指南帮你确认什么
先按任务筛选,再在接入前核对当前API合同与价格
当前模型ID
区分产品名与API实际调用ID
价格边界
展示公开API价格或官方价格入口
可用阶段
区分GA、预览与限量开放
任务匹配
按文本、图像、语音和视频任务对比