多模态大模型 Gemini 3.1
Google多模态大模型,长上下文与视觉理解
安装使用
复制下面这段提示词发给你的 AI(Claude / Cursor / TRAE / Codex / WorkBuddy 等),它会自动帮你完成安装:
帮我安装这个 AI Skill:多模态大模型 Gemini 3.1。 它的用途是:Google多模态大模型,长上下文与视觉理解 完整的 Skill 内容见:https://321skill.com/skills/multimodal-ai-assistant-5/raw/index.md 请读取该页面内容,如果是 SKILL.md 格式直接安装,如果是 README 提炼核心 prompt 后安装。
提示词包含完整的 Skill 内容链接,AI 读取后即可完成安装。你也可以 查看完整内容 确认无误。
使用示例
'请解析这份PDF行业报告,提取所有图表中的关键数据,并以JSON格式输出,包含年份、市场规模、增长率字段。' 它会调用Gemini 3.1模型读取PDF中的图文内容,自动识别表格和图表,返回结构化的JSON数据,可直接用于后续分析。
介绍
Google Gemini 3.1 多模态大模型 Skill 解决的是文档解析、图像/视频理解、结构化输出等复杂场景下的 AI 处理需求。它能够直接读取 PDF、图片、视频中的文字与视觉信息,并生成结构化的 JSON 或 Markdown 格式输出,大幅减少人工二次整理的工作量。
使用方式非常直接:将需要处理的文档、图片或视频文件作为输入,Skill 会自动调用 Gemini 的多模态能力,识别内容并按照你的要求输出摘要、表格、关键信息清单等。支持长上下文,可一次处理数百页文档或长时间视频。
适合数据分析师、学术研究者、内容创作者等经常需要从多模态素材中提取信息的用户。例如,分析师可快速从行业报告中提取关键数据,研究者可解析论文图表,内容创作者可提取视频字幕并生成文案。
建议在使用前明确输出格式要求(如 JSON 结构),并注意 API 调用成本。由于模型依赖网络,离线场景不适用。对于特别复杂的多页文档,可分批处理以提高准确性。
常见问题
Gemini 3.1 支持哪些文件格式?
支持 PDF、图片(JPEG/PNG/WebP)、视频(MP4/MOV)等常见格式,可直接输入文件路径或 URL。
如何处理超长文档?
Gemini 3.1 支持 100 万 token 上下文,可一次性处理数百页文档;若超出限制,建议分段输入并拼接结果。
给 AI 助手的安装指引
如果你的 AI 编程助手(Claude Code、Cursor、TRAE 等)能看到这个页面,把下面这段发给它即可自动完成安装:
请访问 https://321skill.com/skills/multimodal-ai-assistant-5/raw/index.md 读取 多模态大模型 Gemini 3.1 的原始 Skill 定义(Markdown 格式),按其中说明在我的环境里完成安装和配置。
AI 可直接读取的原始 Markdown 地址:/skills/multimodal-ai-assistant-5/raw/index.md(查看排版版本)