中文教程 · 独立阅读版
Gemini 模型:用 Interactions 组织图文输入
按当前官方快速开始,分清应用、AI Studio 与 Interactions API。
进入互动版,练习并保存成果开始前准备
了解 JavaScript 与 JSON,准备一张公开测试图片。本课只阅读和设计请求;若实际运行,需单独配置开发者密钥并核对费用。
1. 先确认你读的是哪套 API
gemini.google.com 是应用;AI Studio 用于开发试验;Gemini API 用于程序调用。当前官方快速开始(来源更新于 2026-09-04 UTC)使用 Interactions API。
本课按这份说明组织 input,并读取 output_text。旧 GenerateContent 教程里的 contents、parts 和 candidates 属于另一套协议,不能与本课字段拼在同一个请求里。
2. 用文字和图片组成 input
官方 JavaScript 示例使用 @google/genai。服务端从环境变量 GEMINI_API_KEY 读取密钥,图片读成 Base64;input 中用 type 区分文字与图片,用 mime_type 说明真实文件类型。
下面按官方图文示例简化,只读 sample.jpg,不添加音频。模型标识来自这次文档示例,不表示所有账号都可调用;运行前检查模型权限和当前 SDK 版本。
import fs from "node:fs";
import { GoogleGenAI } from "@google/genai";
const ai = new GoogleGenAI({});
const interaction = await ai.interactions.create({
model: "gemini-3.8-flash",
input: [
{ type: "text", text: "列出图片中清晰可见的文字,不清晰的内容标为无法辨认。" },
{ type: "image", data: fs.readFileSync("sample.jpg").toString("base64"), mime_type: "image/jpeg" },
],
});
console.log(interaction.output_text);3. 检查返回状态与图片依据
output_text 是 SDK 提供的便捷文本属性;原始响应也有状态和其他输出项。失败、未完成或没有可用文字时先保留未完成状态,不把空文本当成提取成功。
挑三个图片上能看清的字段对照。缺少图片、文件格式不符、图片模糊分别处理;数字还要检查币种和单位。不要根据商品常识补造图中没有的信息。
练习与核对
- 说明 Gemini 应用、AI Studio 与 API 的区别
- 设计一条包含文字和图片的 Interactions 输入
- 列出缺图、模糊和空结果的处理
按实际操作自查,完成标记与成果草稿请在互动版保存。
打开练习与核对带走这一点
先对齐 API 版本与字段,再核对输入材料和输出依据。
资料与核对记录
关键步骤有官方依据已按 2026-09-04 更新的官方快速开始修正为 Interactions 图文输入;不混用旧 GenerateContent 字段。
本次核对公开官方资料,未登录产品账号、运行练习或发起付费调用。
- Gemini API 快速开始
已核对资料 · 获取:2026年9月14日 · 来源更新:2026年9月4日
Interactions API 的图文 input 和 output_text