当前位置: 首页 > article >正文

Java爬虫抓取B站视频信息

依赖

<dependency>
            <groupId>org.jsoup</groupId>
            <artifactId>jsoup</artifactId>
            <version>1.17.2</version> <!-- 最新版可去官网查看 -->
        </dependency>

编码

public static List<VideoDto> parseSearchPage(String keyword, int page,int lim) throws Exception {
        String url = "https://search.bilibili.com/all?keyword=" + keyword + "&page=" + page;
        Document doc = Jsoup.connect(url)
                .userAgent("Mozilla/5.0")
                .timeout(10000)
                .get();
        List<VideoDto> list = new ArrayList<>();
        Elements pictures = doc.select("picture");
        System.out.println("OK");
        int cnt=0;
        for (Element picture : pictures) {

            String pictureSrc = Objects.requireNonNull(picture.selectFirst("source")).attr("srcset");
            String title = Objects.requireNonNull(picture.selectFirst("img")).attr("alt");

            VideoDto videoDto = new VideoDto();
            videoDto.setPicture(pictureSrc);
            videoDto.setTitle(title);
            list.add(videoDto);
            cnt++;
            if(cnt==lim)break;


        }
        Elements divElements = doc.select("div.bili-video-card__info--right");
        cnt=0;
        for(Element divElement : divElements){
            Element firstLink = divElement.selectFirst("a");
            if(firstLink != null){
                String link= firstLink.attr("href");
                VideoDto videoDto=list.get(cnt);
                videoDto.setUrl(link);
                list.set(cnt,videoDto);
                cnt++;
                if(cnt==lim)break;
            }

        }
        return list;
    }

http://www.kler.cn/a/593371.html

相关文章:

  • C#实现的一个简单的软件保护方案
  • Unity框架集合(持续更新)
  • 【最后203篇系列】016 Q201架构思考
  • 移动端高效3D场景重建技术突破:从2D图像到语义化空间理解的范式迁移
  • 私有云大数据部署:从开发到生产(Docker、K8s、HDFS/Flink on K8s)
  • 数学——A. K-divisible Sum + D. Exam in MAC
  • Redis项目:秒杀业务
  • mysql与redis的日志策略
  • 汇能感知高品质的多光谱相机VSC02UA
  • 如何使用MySQL快速定位慢SQL问题?企业级开发中常见业务场景中实际发生的例子,涉及分页查询问题。(二)
  • HTML中required与aria required区别
  • 数字孪生的建模师blender和maya你更喜欢用哪个?
  • 【初学者】算法的学科体系是怎样的?请分章节介绍一下?
  • 计算机四级 - 数据库原理 - 第8章「分布式、对象-关系、NOSQL数据库」
  • 【QT:QT事件】
  • RabbitMQ可靠性进制
  • 汽车安全确认等级-中国等保
  • 【Go语言圣经3.6】
  • numpy学习笔记10:arr *= 2向量化操作性能优化
  • 知识蒸馏(Knowledge Distillation)