若需将网站内容采集并存入数据库以便后续查询与管理,可借助浏览器内置的抓取功能。该功能不受网页格式限制,支持灵活提取各类信息,如新闻正文、商品库存及实时价格、订单详细数据等,满足多样化采集需求。
1、 请先查看待抓取的目标网页,从中提取新闻标题、发布来源及正文内容,并实时存入数据库。操作时,依次打开自动控制菜单,再点击进入项目管理器界面。
2、 在项目管理器中,系统已自动生成默认项目。右键点击该项目,选择新建步骤菜单项,依据实际需求,依次添加抓取内容与执行SQL语句两个功能步骤。
3、 首先新建抓取步骤,点击添加按钮,在弹出的获取动态元素对话框中,选择自动获取,浏览器随即进入元素抓取模式。
4、 当浏览器启用元素抓取功能后,按住鼠标右键在网页上拖动,页面会实时显示一个红色边框,精准框选当前悬停的HTML元素。将右键移至新闻标题位置,点击并从快捷菜单中选择获取元素,系统随即在浏览器右侧面板中锁定该元素的全部信息。默认采用属性匹配方式定位元素,但由于该标题使用的是无ID、无class的H1标签,系统自动切换为以文本内容(text)作为唯一识别依据,确保准确提取标题文字。
5、 依靠元素属性定位标题存在明显局限:一旦切换至其他新闻页面,标题内容变化将导致原定位失效。因此,改用下标方式精准选取——即直接定位页面中第二个H1标签元素。完成配置后,请点击界面右侧确定按钮,以退出元素采集模式,返回项目管理器界面。
6、 获取标题元素后,提取并保存其文本内容。
7、 同样方法添加抓取来源与正文内容。设置完毕后,点击单步测试,再右键目标元素,即可查看实际抓取结果,验证抓取效果是否准确。
8、 请创建一个执行SQL的操作步骤,数据库类型选择SQLite。参照右侧表格结构编写INSERT语句插入数据,所有字段值均通过右键菜单添加变量实现。
9、 新建一个定时任务,每秒执行一次,共运行20次后自动终止。为简化演示,当前仅在同一新闻页面连续采集20次。若需扩展至多个不同页面,可采用多种方式实现,例如预先导入批量URL列表、按顺序逐个点击新闻链接,或实时监测网页内容更新并触发采集动作。
10、 在项目管理器中选中根节点,点击开始按钮运行测试;执行完毕后,可确认数据库已成功写入20条记录。
评论
更多评论