如何用nodeJS抓取HTML及Markdown格式的一级内容?

更新于
2026-09-29 15:12:34
1阅读来源:SEO教程
  • 内容介绍
  • 文章标签
  • 相关推荐

本文共计150个文字,预计阅读时间需要1分钟。

如何用nodeJS抓取HTML及Markdown格式的一级内容?

javascriptGetFirstH1.jsvar fs=require('fs');function getFirstH1(file) { var reg=new RegExp(/\.$/g); var mdreg=new RegExp(/\.md$/g); if (fs.existsSync(file)) { if (reg.test(file)) { var htmf=fs.readFileSync(file, { encoding: 'utf-8' }); // 以下代码省略,以符合字数限制 } else if (mdreg.test(file)) { // 处理MD文件 } }}

如何用nodeJS抓取HTML及Markdown格式的一级内容?

GetFirstH1.js

var fs = require('fs'); function getFirstH1(file) { var htmlreg = new RegExp(/\.html$/g); var mdreg = new RegExp(/\.md$/g); if (fs.existsSync(file)) { if (htmlreg.test(file)) { var htmf = fs.readFileSync(file, { encoding: 'utf-8' }); var H1s = htmf.match(/ /g); if (H1s !== null) { var firstH1 = H1s[0].match(/>.*?]/g, ""); return H1; } }else if(mdreg.test(file)){ var mdf = fs.readFileSync(file,{encoding:'utf-8'}); var H1s = mdf.match(/[#](.*)/g); if(H1s!==null){ var firstH1 = H1s[0].replace(/\#+/g,""); return firstH1; } } } } module.exports ={ getFirstH1 }

本文共计150个文字,预计阅读时间需要1分钟。

如何用nodeJS抓取HTML及Markdown格式的一级内容?

javascriptGetFirstH1.jsvar fs=require('fs');function getFirstH1(file) { var reg=new RegExp(/\.$/g); var mdreg=new RegExp(/\.md$/g); if (fs.existsSync(file)) { if (reg.test(file)) { var htmf=fs.readFileSync(file, { encoding: 'utf-8' }); // 以下代码省略,以符合字数限制 } else if (mdreg.test(file)) { // 处理MD文件 } }}

如何用nodeJS抓取HTML及Markdown格式的一级内容?

GetFirstH1.js

var fs = require('fs'); function getFirstH1(file) { var htmlreg = new RegExp(/\.html$/g); var mdreg = new RegExp(/\.md$/g); if (fs.existsSync(file)) { if (htmlreg.test(file)) { var htmf = fs.readFileSync(file, { encoding: 'utf-8' }); var H1s = htmf.match(/ /g); if (H1s !== null) { var firstH1 = H1s[0].match(/>.*?]/g, ""); return H1; } }else if(mdreg.test(file)){ var mdf = fs.readFileSync(file,{encoding:'utf-8'}); var H1s = mdf.match(/[#](.*)/g); if(H1s!==null){ var firstH1 = H1s[0].replace(/\#+/g,""); return firstH1; } } } } module.exports ={ getFirstH1 }