Spark版Java 1.8 WordCount如何实现长尾词统计?

更新于
2026-10-04 11:43:32
3阅读来源:SEO问题
  • 内容介绍
  • 文章标签
  • 相关推荐

本文共计199个文字,预计阅读时间需要1分钟。

Spark版Java 1.8 WordCount如何实现长尾词统计?

javaimport java.util.Arrays;import org.apache.spark.api.java.JavaPairRDD;import org.apache.spark.api.java.JavaRDD;import org.apache.spark.sql.SparkSession;import scala.Tuple2;

public class WordCount3 { public static void main(String[] args) { SparkSession spark=SparkSession.builder().appName(Word Count).getOrCreate(); JavaRDD textFile=spark.sparkContext().textFile(path/to/textfile.txt); JavaRDD words=textFile.flatMap(line -> Arrays.asList(line.split( )).iterator()); JavaPairRDD pairs=words.mapToPair(word -> new Tuple2(word, 1)); JavaPairRDD counts=pairs.reduceByKey((a, b) -> a + b); counts.collect().forEach(System.out::println); spark.stop(); }}

WordCount

import java.util.Arrays; import org.apache.spark.api.java.JavaPairRDD; import org.apache.spark.api.java.JavaRDD; import org.apache.spark.sql.SparkSession; import scala.Tuple2; public class WordCount3 { public static void main(String[] args) { SparkSession spark = SparkSession.builder().master("local").appName("WordCount3").getOrCreate(); JavaRDD input = spark.read().textFile("words.txt").javaRDD(); JavaRDD words = input.flatMap(line -> Arrays.asList(line.split(",")).iterator()); JavaPairRDD pair = words.mapToPair(word -> new Tuple2 (word, 1)); JavaPairRDD output = pair.reduceByKey((v1, v2) -> v1+v2); output.foreach(res -> System.out.println(res)); } }

Spark版Java 1.8 WordCount如何实现长尾词统计?

本文共计199个文字,预计阅读时间需要1分钟。

Spark版Java 1.8 WordCount如何实现长尾词统计?

javaimport java.util.Arrays;import org.apache.spark.api.java.JavaPairRDD;import org.apache.spark.api.java.JavaRDD;import org.apache.spark.sql.SparkSession;import scala.Tuple2;

public class WordCount3 { public static void main(String[] args) { SparkSession spark=SparkSession.builder().appName(Word Count).getOrCreate(); JavaRDD textFile=spark.sparkContext().textFile(path/to/textfile.txt); JavaRDD words=textFile.flatMap(line -> Arrays.asList(line.split( )).iterator()); JavaPairRDD pairs=words.mapToPair(word -> new Tuple2(word, 1)); JavaPairRDD counts=pairs.reduceByKey((a, b) -> a + b); counts.collect().forEach(System.out::println); spark.stop(); }}

WordCount

import java.util.Arrays; import org.apache.spark.api.java.JavaPairRDD; import org.apache.spark.api.java.JavaRDD; import org.apache.spark.sql.SparkSession; import scala.Tuple2; public class WordCount3 { public static void main(String[] args) { SparkSession spark = SparkSession.builder().master("local").appName("WordCount3").getOrCreate(); JavaRDD input = spark.read().textFile("words.txt").javaRDD(); JavaRDD words = input.flatMap(line -> Arrays.asList(line.split(",")).iterator()); JavaPairRDD pair = words.mapToPair(word -> new Tuple2 (word, 1)); JavaPairRDD output = pair.reduceByKey((v1, v2) -> v1+v2); output.foreach(res -> System.out.println(res)); } }

Spark版Java 1.8 WordCount如何实现长尾词统计?