服务与工具
PageIndex
PageIndex:网页索引与检索服务(需鉴权)
9 个可用工具
find_ relevant_ documents
Search documents by query. Uses fast keyword matching against names and descriptions first; automatically falls back to AI semantic ranking when no keyword results are found. Best for specific terms, …
list_ folders
列出用户的文件夹。通过parent_folder_id筛选以获取特定文件夹的子项,使用null获取根文件夹,或省略以获取所有文件夹。
get_ document
按名称获取特定文档的详细信息。必填:doc_name(字符串)。可选:wait_for_completion(布尔值)可在文档仍在处理时自动等待最多3分钟。返回文档状态、元数据及基于处理状态和文档大小的智能后续步骤建议。使用此工具检查文档是否准备好后再调用get_document_structure()或get_page_content()。
get_ document_ image
从文档中提取嵌入图片。需要使用get_page_content()响应中的image_path,格式为<文档名>/<图片路径>(例如MyDoc.pdf/figures/fig1.png)。返回image_base64和content_type用于渲染。请勿在文本响应中重复原始image_base64值。
get_ document_ structure
提取已完成文档的层次结构。可选:wait_for_completion(布尔值)可在仍在处理时等待最多3分钟。返回带标题、章节和页码引用的结构化大纲。文档超过20页必需使用——先使用此工具了解布局并识别相关章节,然后再提取内容。对于有针对性的问题,使用结构定位相关页面,然后使用get_page_content()提取。
get_ page_ content
从已处理的文档中提取指定页面内容。灵活的页面选择:单页('5')、范围('3-7')或多页('1,5,10')。使用紧凑的目标范围,必要时拆分为多次调用。避免一次性提取整个文档。可选:wait_for_completion(布尔值)可在处理中时等待最多3分钟。返回带图片路径的结构化文本内容。要获取嵌入图片:使用此响应中的图片路径调用get_document_image()。对于超过20页的文档,先…
process_ document
从公开URL上传并处理PDF文档。仅在有有效、可访问的PDF URL时调用。如果用户未提供,请询问而非猜测。返回用于后续操作的文档名。支持最大100MB的文件。处理后,使用get_document()检查状态后再访问内容。
recent_ documents
分页浏览您的文档集合。返回按上传日期排序的文档(最新优先)及处理状态。支持基于游标的大集合分页。在探索文档或用户询问其文档时优先使用此工具。定向搜索请改用find_relevant_documents()。对于与文档无任何关联的问题(如常识问题)完全跳过搜索。
remove_ document
永久删除文档及相关所有数据。仅在用户明确指定文档名称并确认删除时调用。接受文档名称数组进行批量删除(每批最多10个)。返回每个文档的详细成功/失败状态。警告:此操作不可逆,删除的文档无法恢复。