Java 实战:基于 Spire.Doc 高效提取 Word 文档文本与图片
在 Java 项目开发中经常会遇到 Word 文档解析需求比如文档内容归档、数据结构化提取、素材批量导出等。传统 POI 框架处理 Word 文档存在 API 繁琐、图片提取兼容性差、高版本 docx 适配漏洞多等问题而Spire.Doc for Java是一款轻量化、高性能的 Word 文档处理组件无需依赖 Office 环境能够极简实现 Word 文本、图片、表格等内容的精准提取适配绝大多数企业级开发场景。本文将手把手讲解如何通过 Maven 引入 Spire.Doc 依赖分别实现 Word 文档全文文本提取、内嵌图片批量导出提供完整可运行代码及详细解析零基础也可快速上手。一、技术简介与环境准备1.1 组件优势Spire.Doc for Java 是专业的 Java Word 处理库支持 .doc、.docx 全格式文档解析核心优势如下无需安装 Microsoft Office、接口简洁易用、解析精度高、支持批量文档处理完美解决原生 POI 解析 Word 出现的乱码、图片丢失、格式错乱等问题。1.2 Maven 依赖配置首先我们需要在项目的pom.xml文件中添加 Spire.Doc for Java 的依赖仓库和依赖项repositories repository idcom.e-iceblue/id namee-iceblue/name urlhttps://repo.e-iceblue.com/nexus/content/groups/public//url /repository /repositories dependencies dependency groupIde-iceblue/groupId artifactIdspire.doc/artifactId version14.7.4/version /dependency /dependencies配置完成后刷新 Maven 项目自动下载对应依赖包即可开展文档解析开发。二、实战一提取 Word 全部文本并导出 TXT 文件Spire.Doc 提供极简的getText()方法可一键获取文档全部纯文本内容自动过滤图片、格式符号、控件等无效内容同时支持将提取的文本持久化保存为 TXT 文件方便内容归档。完整代码实现import com.spire.doc.Document; import java.io.FileWriter; import java.io.IOException; public class ExtractText { public static void main(String[] args) throws IOException { // 1. 创建文档对象并加载本地Word文档 Document document new Document(); document.loadFromFile(sample1.docx); // 2. 提取文档全部文本内容 String textdocument.getText(); // 3. 将文本写入本地TXT文件 writeStringToTxt(text,ExtractedText.txt); System.out.println(Word文本提取完成已保存至ExtractedText.txt); } /** * 文本内容写入TXT文件工具方法 * param content 提取的文本内容 * param txtFileName 输出文件名 * throws IOException IO异常 */ public static void writeStringToTxt(String content, String txtFileName) throws IOException{ // 追加模式写入文件 FileWriter fWriter new FileWriter(txtFileName,true); try { fWriter.write(content); }catch(IOException ex){ ex.printStackTrace(); }finally{ // 强制刷新流并关闭资源避免内存泄漏 try{ fWriter.flush(); fWriter.close(); } catch (IOException ex) { ex.printStackTrace(); } } } }代码解析初始化Document核心对象通过loadFromFile()加载本地 Word 文档支持相对路径与绝对路径调用getText()快速解析全文文本自动保留文档原有文字排版逻辑自定义文件写入工具方法采用追加模式写入 TXT 文件finally 代码块强制关闭流规避 IO 资源泄漏问题。三、实战二批量提取 Word 内嵌图片并导出 PNGWord 文档中的图片嵌套在文档节点中无法通过简单 API 直接获取。Spire.Doc 支持遍历文档树形结构精准识别所有图片节点批量提取图片并导出为 PNG 格式适配正文、段落、文本框中所有内嵌图片。完整代码实现import com.spire.doc.*; import com.spire.doc.documents.*; import com.spire.doc.fields.*; import com.spire.doc.interfaces.*; import javax.imageio.ImageIO; import java.awt.image.BufferedImage; import java.io.*; import java.util.*; public class ExtractImage { public static void main(String[] args) throws IOException { // 1. 加载Word文档 Document document new Document(); document.loadFromFile(sample2.docx); // 2. 初始化队列遍历文档树形节点 QueueICompositeObject nodes new LinkedList(); nodes.add(document); ListBufferedImage images new ArrayList(); // 3. 深度遍历文档筛选图片节点 while (nodes.size() 0) { ICompositeObject node nodes.poll(); for (int i 0; i node.getChildObjects().getCount(); i) { IDocumentObject child node.getChildObjects().get(i); // 递归添加复合节点继续深度遍历 if (child instanceof ICompositeObject) { nodes.add((ICompositeObject) child); } // 识别图片节点并收集图片 else if (child.getDocumentObjectType() DocumentObjectType.Picture) { DocPicture picture (DocPicture) child; images.add(picture.getImage()); } } } // 4. 创建输出目录批量保存图片 File outputDir new File(output); if (!outputDir.exists()){ outputDir.mkdirs(); } for (int i 0; i images.size(); i) { File file new File(String.format(output/extractImage-%d.png, i)); ImageIO.write(images.get(i), PNG, file); } System.out.println(图片提取完成共提取images.size()张图片); } }代码解析采用队列实现文档节点深度遍历覆盖文档所有层级节点避免遗漏嵌套图片通过DocumentObjectType.Picture精准匹配图片节点将图片对象存入集合自动判断输出目录是否存在不存在则创建避免文件保存报错循环将图片以 PNG 格式批量导出自定义文件名有序存储方便后续管理。四、运行注意事项与常见问题文档路径问题测试时将 Word 文档放置项目根目录正式环境建议使用绝对路径防止文件找不到异常依赖加载失败若仓库拉取依赖失败可手动下载 Jar 包导入项目图片空白问题遍历逻辑覆盖全节点可完美适配图文混排、嵌套复杂的 Word 文档无图片丢失、空白问题资源释放批量处理文档时可通过document.dispose()手动释放文档资源降低内存占用。五、总结本文基于 Spire.Doc for Java 组件实现了 Word 文档文本提取、图片批量导出两大核心功能相较于传统 POI 方案代码更简洁、兼容性更强、解析稳定性更高。该方案可快速落地于文档解析、内容检索、素材提取、办公自动化等业务场景是 Java 开发中处理 Word 文档的优质解决方案。开发者可基于本文代码拓展功能比如指定段落文本提取、图片格式自定义、批量文档遍历解析等。