用PHP换个思路读取WORD内容

发布时间:2022-05-15 发布网站:脚本宝典
脚本宝典收集整理的这篇文章主要介绍了用PHP换个思路读取WORD内容脚本宝典觉得挺不错的,现在分享给大家,也给大家做个参考。

项目:问卷

需求:WORD 导入问卷

背景:运营那里有几百个 WORD 格式问卷,如果去后台手动录入,无疑工作量很大,希望能直接导入。

心情:接到需求之后五味杂陈,因为以前做过 excel 导入,而且有现成的插件,代码也是一搜索一堆。

word 导入无疑涉及到了知识盲点,但是需求就在那里,又怼不过产品同学!只能硬着头皮上了。

难点:word 不好读取内容,内容读出来不好结构化。

解决问题思路:

先读取 WORD, 再说怎么结构化。

读取 WORD:

开始想着用 PHPWORD, 毕竟 PHPOFFICE 这么成熟的插件应该可以直接读取到 WORD 内容吧。

然而现实很骨感,找遍了文档并没有找到直接读取到 WORD 内容的方法。PHPWORD 只提供了把 WORD 转换成 HTML,TDF 的方法。

转换思路:

既然不能读取 WORD, 那我可以读取 HTML, 只需要把 WORD 转换成 HTML 就可以了,然后读取 HTML 内容就行。

代码:

<?php
namespace App\Console\Commands;
use Illuminate\Console\Command;
use PhpOffice\PhpSPReadsheet\Reader\Html;
use PhpOffice\PhpWord\Reader\Word2007;
class test extends Command {
    /**
     * The name and signature of the console command.
     *
     * @VAR string
     */
    protected $signature = &#39;word';
    /**
     * The console command description.
     *
     * @var string
     */
    protected $description = 'word';
    /**
     * Create a new command instance.
     *
     * @return void
     */
    public function __construct() {
        parent::__construct();
    }
    /**
     * Execute the console command.
     *
     * @return int
     */
    public function handle(Word2007 $word) {
        //WORD转换HTML
        $result=$word->load(storage_path('测试.docx'));
        $wrITe=new \PhpOffice\PhpWord\Writer\HTML($result);
        $write->save(storage_path().'/测试.html');
        //读取HTML内容
        $document=new \DOMDocument();
        $document->loadhtml(file_get_contents(storage_path('测试.html')));
        $html=simpleXMl_import_dom($document);
        dd((array)$html->body);
    }
}

开始测试:新建 测试.docx

测试.docx 内容:

f777ab8394a4c064fd71e3e5e44bce0.png

执行脚本:

php artisan word

结果:

0a6f8646774a9ceb6098cb18e351dcc.png

以上就是用PHP换个思路读取WORD内容的详细内容,更多请关注脚本宝典其它相关文章

脚本宝典总结

以上是脚本宝典为你收集整理的用PHP换个思路读取WORD内容全部内容,希望文章能够帮你解决用PHP换个思路读取WORD内容所遇到的问题。

如果觉得脚本宝典网站内容还不错,欢迎将脚本宝典推荐好友。

本图文内容来源于网友网络收集整理提供,作为学习参考使用,版权属于原作者。
如您有任何意见或建议可联系处理。小编QQ:384754419,请注明来意。
标签: