ChatGPT 是什么:OpenAI 的对话式 AI 助手能做哪些事

AI百科 ·

ChatGPT 是 OpenAI 推出的对话式 AI 助手,官方描述为支持文本、图像、文件与语音多模态交互,具备代码执行、联网检索与自定义 GPT 等能力,并称其是目前用户规模最大的通用大模型产品。

它是很多人接触 AI 的第一个产品,也正因如此,围绕它的误解最多。这篇文章按能力分层说清楚它到底能做什么。

定位:一个以对话为界面的通用助手

ChatGPT 的产品形态是「对话」。你提问,它回答,你追问,它接着答。这个界面看起来简单,却是它普及速度快的重要原因——不需要学任何操作,会打字就会用。

但对话只是外壳,它本质上是通用大模型产品:不限定行业,不限定任务类型。写文案、解释概念、翻译、写代码、整理资料,都可以在同一个对话框里完成。

通用性的另一面是它不会自带你所在行业的默认知识。想让回答贴合你的场景,需要你在提问里把背景、约束和期望格式讲清楚。

多模态交互:文本、图像、文件与语音

官方描述把交互方式列为文本、图像、文件与语音四类。

这四类对应不同的输入需求。文本是最常用的;图像适合处理截图、图表、手写内容这类不好用文字描述清楚的东西;文件适合长材料,直接上传比逐段粘贴更省事;语音则降低了输入门槛,也适合边走边用的场景。

多模态的实际意义是减少「把信息翻译成文字」这一步损耗。一张结构复杂的图,用文字描述出来往往已经失真,能直接传图就避免了这个问题。

代码执行、联网检索与自定义 GPT

官方描述提到的三项能力,各自解决一类具体的短板。

代码执行让它可以运行代码并给出结果,而不只是输出一段可能没法跑通的代码文本,这对数据处理、计算类任务很关键。联网检索解决的是知识时效问题——模型自身的训练数据有截止时间,检索让它能拿到更新的信息。

自定义 GPT 则指向复用:把一套固定的指令和资料封装成一个专门的助手,下次直接调用,不必每次重新交代背景。对反复处理同类任务的人来说,这是省时间的地方。

「用户规模最大」说明了什么

官方描述称它是目前用户规模最大的通用大模型产品。

规模带来的直接结果是生态成熟:教程、模板、第三方工具和现成的提示词最多,遇到问题更容易找到答案。对新手来说,这是很实际的优势。

同时也要清楚,规模大不等于在所有任务上都最强。不同产品在长文本、代码、特定语言上的侧重并不相同,选择时要看自己的主要用途。

使用时要注意什么

有三点值得留意。一是模型会生成看起来合理但实际错误的内容,涉及数据、引用、法条这类内容必须自己核对来源。二是不要把个人隐私、账号密码、公司机密提交进去。三是同一个问题换一种问法,答案质量可能差别很大,追问和补充约束往往比重新开一个对话更有效。

小结

  • ChatGPT 由 OpenAI 推出,产品形态是对话式 AI 助手
  • 官方描述支持文本、图像、文件与语音多模态交互
  • 具备代码执行、联网检索与自定义 GPT 等能力
  • 官方称其为目前用户规模最大的通用大模型产品
  • 生态成熟是新手友好的优势,但并非所有任务上都最强
  • 输出内容需自行核对,敏感信息不要提交
阅读 1