当前位置：首页 > 工具软件 > Heritrix > 使用案例 >

Heritrix使用detail

鲜于凯康

2023-12-01

关于Heritrix的Extractor中文乱码

继承从org.archive.crawler.extractor.Extractor的子类，在extract方法中可以从参数CrawlURI中取出要解析的内容。

curi.getHttpRecorder().getReplayCharSequence.toString()

有中文时，不做处理会输出乱码。可以在取到的HttpRecorder后设置编码：

HttpRecorder hr = curi.getHttpRecorder();

if ( hr == null ) {

    throw new IOException( "Why is recorder null here?" );

}

hr.setCharacterEncoding( "gb2312" );

cs = hr.getReplayCharSequence();

System.out.println( cs.toString() );

类似资料：

Heritrix使用detail

关于Heritrix的Extractor中文乱码

相关阅读

相关文章

相关问答

相关文档