AI基础认知

大模型都有哪些

很多人一提到大模型,第一反应就是: 不就是像 ChatGPT 一样聊天的吗? 其实这只是大模型的一部分。 今天的大模型,已经不只是“会聊天”,而是可以处理多种不同类型的内容。

大模型都有哪些

image.png

大模型都有哪些

很多人一提到大模型,第一反应就是:

不就是像 ChatGPT 一样聊天的吗?

其实这只是大模型的一部分。

今天的大模型,已经不只是“会聊天”,而是可以处理多种不同类型的内容。

你可以把它理解成:

不同类型内容的 AI 处理器。

有的擅长处理文字,

有的擅长生成图片,

有的擅长做视频,

还有的能够直接帮你执行任务。

大模型不是单一工具,而是一整套能力体系。

一、文字类大模型

这是目前大家最熟悉的一类大模型,它最擅长处理文字内容,比如:聊天问答,写文章,总结内容,翻译改写,提炼重点,生成方案等

像我们平时接触比较多的:Chatgpt,Claude,通义千问,豆包,Deepseek等 大多数都处于这一类,或者至少是以文字能力为基础的。

对于大部分人来说,文字类大模型最常见的用途就是:帮你“想”、帮你“写”、帮你“整理”。

二、图像类大模型

图像类大模型,主要负责处理图片。

它可以做的事情包括:

  • 文生图:根据文字生成图片
  • 以图改图:根据现有图片进行修改
  • 修图补图
  • 理解图片内容
  • 根据图片生成描述

比如你输入一句:

帮我生成一张科技感的课程封面图

它就能直接生成图片。

对普通人来说,这类模型最实用的地方在于:

以前做图需要设计能力,现在很多时候只需要会描述需求。

三、视频类大模型

视频类大模型,是近两年发展很快的一类。

它主要处理视频相关任务,比如:

  • 文生视频
  • 图生视频
  • 视频内容理解
  • 视频剪辑辅助
  • 视频生成和延展

比如输入一句话:

生成一个城市夜景的短视频

AI 就可能直接帮你生成一段画面。

这类模型的意义在于:

它让视频创作的门槛开始降低了。

过去做视频,需要拍摄、剪辑、配音、配乐。

未来很多内容,可能只需要“会表达想法”。

四、语音类大模型

语音类大模型主要处理“听”和“说”。

它可以做的事情包括:

  • 语音转文字
  • 文字转语音
  • 语音对话
  • 会议转录
  • 语音理解

比如:

  • 把一段录音整理成文字
  • 把文章变成配音
  • 和 AI 直接进行语音交流

对很多办公场景来说,这类模型特别有用。

比如开会、做笔记、做课程、做短视频,语音类能力都会大量用到。

五、音乐 / 音频类大模型

这一类主要处理音乐、配乐和音效。

它可以做的事情包括:

  • 文生音乐
  • 生成配乐
  • 生成音效
  • 人声处理
  • 音频优化

比如:

生成一段轻松、科技感的背景音乐

AI 就能自动帮你做出来。

这类模型虽然没有文字模型那么普及,但在短视频、课程、广告、配音场景里,价值会越来越大。

六、代码类大模型

代码类大模型,主要是帮助编程和开发。

它能做的事情包括:

  • 写代码
  • 改 Bug
  • 解释代码
  • 生成网页
  • 生成小工具
  • 辅助开发

像你现在的 Codex、Cursor、Claude Code,这些就和代码类大模型高度相关。

对程序员来说,它像一个开发助手。

对普通人来说,它的意义更大:

即使你不会写代码,也可以借助 AI 做出一些简单的软件、小工具或自动化流程。

七、多模态大模型

多模态大模型,指的是它不只会处理一种内容,而是能同时处理多种内容。

比如它既能看文字,也能看图片;

既能听语音,也能理解视频。

它可以完成:

  • 看图回答
  • 读文档和表格
  • 听语音做理解
  • 综合分析多种信息

这类模型的重要意义在于:

它更接近人类处理信息的方式。

因为现实生活中,我们面对的从来不是单一信息,而是文字、图片、语音、视频混合在一起的。

八、决策 / 智能体能力

这部分其实可以理解为:

大模型不再只是“回答问题”,而是开始“帮你做事”。

它可以做的事情包括:

  • 拆解任务
  • 制定步骤
  • 调用工具
  • 自动执行流程
  • 输出最终结果

比如你告诉 AI:

帮我做一份市场分析报告

未来它可能不是只给你一段回答,而是会:

  1. 先理解任务
  2. 再搜索资料
  3. 整理数据
  4. 生成文档
  5. 最后把结果交给你

这就是从“大模型”走向“智能体”的方向。

也就是说,AI 正在从一个工具,逐步变成一个助手,甚至是一个执行者。