本页可直接阅读、选中文本复制或打印。文中的复制按钮、判断练习和成果保存,请使用互动版。

中文教程 · 独立阅读版

Gemini 模型:用 Interactions 组织图文输入

按当前官方快速开始,分清应用、AI Studio 与 Interactions API。

内容整理:2026-09-07 · 资料核对:2026年9月14日

进入互动版,练习并保存成果

开始前准备

了解 JavaScript 与 JSON,准备一张公开测试图片。本课只阅读和设计请求;若实际运行,需单独配置开发者密钥并核对费用。

1. 先确认你读的是哪套 API

gemini.google.com 是应用;AI Studio 用于开发试验;Gemini API 用于程序调用。当前官方快速开始(来源更新于 2026-09-04 UTC)使用 Interactions API。

本课按这份说明组织 input,并读取 output_text。旧 GenerateContent 教程里的 contents、parts 和 candidates 属于另一套协议,不能与本课字段拼在同一个请求里。

2. 用文字和图片组成 input

官方 JavaScript 示例使用 @google/genai。服务端从环境变量 GEMINI_API_KEY 读取密钥,图片读成 Base64;input 中用 type 区分文字与图片,用 mime_type 说明真实文件类型。

下面按官方图文示例简化,只读 sample.jpg,不添加音频。模型标识来自这次文档示例,不表示所有账号都可调用;运行前检查模型权限和当前 SDK 版本。

JavaScript · 官方示例改编,未执行付费调用
import fs from "node:fs";
import { GoogleGenAI } from "@google/genai";

const ai = new GoogleGenAI({});
const interaction = await ai.interactions.create({
  model: "gemini-3.8-flash",
  input: [
    { type: "text", text: "列出图片中清晰可见的文字,不清晰的内容标为无法辨认。" },
    { type: "image", data: fs.readFileSync("sample.jpg").toString("base64"), mime_type: "image/jpeg" },
  ],
});
console.log(interaction.output_text);

3. 检查返回状态与图片依据

output_text 是 SDK 提供的便捷文本属性;原始响应也有状态和其他输出项。失败、未完成或没有可用文字时先保留未完成状态,不把空文本当成提取成功。

挑三个图片上能看清的字段对照。缺少图片、文件格式不符、图片模糊分别处理;数字还要检查币种和单位。不要根据商品常识补造图中没有的信息。

练习与核对

按实际操作自查,完成标记与成果草稿请在互动版保存。

打开练习与核对

带走这一点

先对齐 API 版本与字段,再核对输入材料和输出依据。

资料与核对记录

关键步骤有官方依据

已按 2026-09-04 更新的官方快速开始修正为 Interactions 图文输入;不混用旧 GenerateContent 字段。

本次核对公开官方资料,未登录产品账号、运行练习或发起付费调用。

步骤对不上?在互动版生成问题记录