案例 / CASE STUDY

多模态对话 · 文档学习

AI 作业帮

整合多轮对话、图片输入和 DOCX、PPTX、PDF 文档解析,以多笔记本与流式响应承载连续学习过程。

AI 作业帮多模态学习工作台概念图

01

项目背景

学习材料散落在题目截图、Word、PPT、PDF 和笔记中,频繁复制粘贴会打断提问与追问的连续性。

02

核心挑战

让图片和不同格式的文档进入同一条对话链路,同时保存各笔记本的上下文并及时反馈长回答。

03

解决方案

解析 DOCX、PPTX、PDF 与文本文件,结合图片输入、多轮对话记忆和 SSE 流式响应,形成多笔记本学习工作台。

04

关键能力

  • 多轮对话记忆
  • 图片输入
  • 多格式文档解析
  • 多笔记本管理
  • SSE 流式响应

05

最终成果

完成从材料导入、连续追问到答案留存的学习辅助原型,让用户围绕同一份资料持续理解问题,而不是反复补充上下文。

在线体验

项目实现

后端解析 DOCX、PPTX、PDF 与文本文件,将文档内容和图片输入统一交给对话模型;通过 conversation_id 保持多轮上下文,并以 SSE 持续返回结果。

真实能力

前端提供多笔记本管理与本地持久化,用户可以围绕同一份学习材料连续提问、查看历史并继续追问。