news 2026/10/1 11:54:04

java 爬虫大型教程(一)

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
java 爬虫大型教程(一)

java 爬虫大型教程(一)

在开始之前, 鉴于这是一份大型的教程, 我们应当从最基础的环境变量配置环节说起, 逐步展开详细的搭建过程。

关于电脑环境这块, 因为我的这台设备是 pro 型号嘛, 所以系统环境变量配置的方式, 和标准版本的那些机器, 它是不一样的。要是大家手里的电脑不是 pro 这种规格, 而是其他类型的系统, 那你去百度一下相关的环境变量配置教程就对了。

关于爬虫框架这一块, 其实我们正在使用的就是目前国内非常靠谱的一个方案, 它的设计思路是借鉴来自于其他的成熟框架。

Java环境搭建

首先得说明一个情况, 是从2019年1月份才开始进行版本更新的, 到了jdk8 u201这个版本, 对于公司的用户而言, 就开始实行收费政策了。

因此, 如果你的公司还没有去申请购买相关许可的话, 那就必须得使用jdk8 u131或者是比它更早的jdk版本才行, 不然的话, 公司是可能会被起诉的。当然, 如果你是纯粹出于个人学习目的来使用的, 那就没有什么特别的限制了, 怎么选用都行。

咱们先把JDK8 U191的下载地址给列出来, 大家记得要把这个地址好好地保存下来哦, 具体的地址如下所示。

关于Java的下载、安装以及配置环节, 此处就不再过多赘述了,因为这方面的内容实在是太过基础, 而在确认安装成功之后。

MacBook-Pro:~ duke$ java -version

java version "1.8.0_191"

Java(TM) SE Runtime Environment (build 1.8.0_191-b12)

Java HotSpot(TM) 64-Bit Server VM (build 25.191-b12, mixed mode)

你需要搭建Maven环境, 首先需要下载一份安装包。

官方下载地址是这里, 你可以点进去看。

如图:

2.解压指定位置。

你能够把maven文件夹直接解压并存放于任意一个位置, 在这篇内容里, 我把maven放置到了/Users/duke//这一具体路径中关于具体的解压操作过程就不需要再多做说明。

我来只是非常简要地做一个叙述, 去把Maven这个东西说一说, 咱们知道Java程序在运行的时候需要各种不同类型的jar包存在, 这个情况下你可能会必须花费非常多的心力和体力去处理这些jar包本身以及相关的整个环境配置的一系列问题, 然而使用Maven这个方法就可以直接把这些困难都给解决掉了, 这里边还有一点是如果你曾经使用过Git这个工具的话你就能很清楚其中的道理了, 也就是说代码在工作流程上是首先需要先处于本地的仓库空间内部的, 然后才会进一步地发生一个动作, 那就是被推送到位于远端的那个由Git管理的仓库之中去的。

maven也是同样的道理, 它会存在一个本地仓库, 如果在java代码中使用了相关的jar包, 那么就会先去本地仓库里进行寻找, 一旦在本地仓库中没有找到相应的文件, 就会向远程仓库发出请求, 然后将其下载到本地仓库里面去供后续的使用。

3.环境配置

① 打开终端 ,输入vim ~/.bash_profile

② 输入i进入编辑模式,然后输入 Maven 的环境变量

export M2_HOME="/Users/duke/Documents/Software/apache-maven-3.6.0"

export PATH="$M2_HOME/bin:$PATH"

③ 编辑完后,按 esc 退出编辑,并输入 :wq 保存并退出。

④ 输入 source ~/.bash_profile 使环境变量生效。

⑤ 输入 mvn -v 查看 Maven 否安装成功。

4.把原本的那个用来进行下载的软件包管理工具里的源地址给替换掉。

① 用IDEA或Eclipse打开/Users/duke/Documents/Software/apache-maven-3.6.0/conf/settings.xml

② 找到mirrors元素(150行左右), 在它里面添加子元素mirror

<mirror>

<id>nexus-aliyunid>

<mirrorOf>*mirrorOf>

<name>Nexus aliyunname>

<url>http://maven.aliyun.com/nexus/content/groups/publicurl>

mirror>

在IDEA里头, 大家是用那一个叫maven的方法啊, 来来去去地创建一个简单的, 专门负责爬取网络数据的项目的。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/1 11:53:00

python多线程并发测试过程

进行多线程并发测试的过程。更新时间为2025年05月27日15点25分35秒, 作者是姑娘别秃头。这篇文章主要的内容是介绍了关于多线程并发的测试过程, 这样的资料是具有非常好的参考价值的, 希望能够帮助到大家, 如果文章中存在错误或没有考虑完全的情况, 希望读者能够不吝赐教。一、…

作者头像 李华
网站建设 2026/10/1 11:52:35

Ember-1模型:大模型推理Token压缩40%的工程实践

1. 项目概述&#xff1a;一场被低估的推理效率革命Fireworks AI 这次发布的 Ember-1 模型&#xff0c;表面看只是“基于 Kimi K3 的后训练模型”&#xff0c;但真正值得所有开发者、算法工程师和产品技术负责人坐直身体细读的&#xff0c;是那句轻描淡写的“推理 Token 减少约 …

作者头像 李华
网站建设 2026/10/1 11:50:46

openclaw重启实战:从systemd到Docker的完整排查指南

1. 为什么“重新启动”会成为 openclaw 的日常操作先说个场景&#xff1a;我是在一台 Ubuntu 服务器上用一键部署脚本装的 openclaw&#xff0c;当时图省事&#xff0c;一切按默认配置跑起来。最初一两个月相安无事&#xff0c;直到有一次我改了配置文件里的模型参数&#xff0…

作者头像 李华
网站建设 2026/10/1 11:50:40

Agent记忆系统实战:基于MCP与混合检索的hindsight架构设计

1. 从“hindsight”说起&#xff1a;为什么记忆是 Agent 落地的最后一公里“hindsight”这个词本身很有意思&#xff0c;字面意思是“事后的洞察力”&#xff0c;也就是我们常说的“后见之明”。把这个词放到 Agent 和 LLM 的语境里&#xff0c;它指向的东西非常具体&#xff1…

作者头像 李华
网站建设 2026/10/1 11:49:55

HTML5 video事件详解:duration、timeupdate、ended的坑与实战

先直接抛个结论&#xff1a;HTML5 的 video 标签&#xff0c;难点从来不是怎么把视频放上去&#xff0c;而是怎么处理和播放相关的各种状态和时间信息。你去看网上一堆教程&#xff0c;翻来覆去就那几个 API 名字&#xff1a;duration、currentTime、ended事件。但真到项目里一…

作者头像 李华