多模态大模型 Gemini 3.1

Google多模态大模型,长上下文与视觉理解

安装使用

复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:

帮我安装这个 AI Skill:多模态大模型 Gemini 3.1。
它的用途是:Google多模态大模型,长上下文与视觉理解
完整的 Skill 内容见:https://321skill.com/skills/multimodal-ai-assistant-5/raw/index.md
请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。

提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。

使用示例

'请解析这份PDF行业报告,提取所有图表中的关键数据,并以JSON格式输出,包含年份、市场规模、增长率字段。' 它会调用Gemini 3.1模型读取PDF中的图文内容,自动识别表格和图表,返回结构化的JSON数据,可直接用于后续分析。

介绍

Google Gemini 3.1 多模态大模型 Skill 解决的是文档解析、图像/视频理解、结构化输出等复杂场景下的 AI 处理需求。它能够直接读取 PDF、图片、视频中的文字与视觉信息,并生成结构化的 JSON 或 Markdown 格式输出,大幅减少人工二次整理的工作量。

使用方式非常直接:将需要处理的文档、图片或视频文件作为输入,Skill 会自动调用 Gemini 的多模态能力,识别内容并按照你的要求输出摘要、表格、关键信息清单等。支持长上下文,可一次处理数百页文档或长时间视频。

适合数据分析师、学术研究者、内容创作者等经常需要从多模态素材中提取信息的用户。例如,分析师可快速从行业报告中提取关键数据,研究者可解析论文图表,内容创作者可提取视频字幕并生成文案。

建议在使用前明确输出格式要求(如 JSON 结构),并注意 API 调用成本。由于模型依赖网络,离线场景不适用。对于特别复杂的多页文档,可分批处理以提高准确性。

常见问题

Gemini 3.1 支持哪些文件格式?

支持 PDF、图片(JPEG/PNG/WebP)、视频(MP4/MOV)等常见格式,可直接输入文件路径或 URL。

如何处理超长文档?

Gemini 3.1 支持 100 万 token 上下文,可一次性处理数百页文档;若超出限制,建议分段输入并拼接结果。

给 AI 助手的安装指引

如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:

请访问 https://321skill.com/skills/multimodal-ai-assistant-5/raw/index.md 读取 多模态大模型 Gemini 3.1 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。