FlinkAPI开发之状态管理_代码007(未授权)

本文介绍: Flink的状态有两种：托管状态（Managed State）和原始状态（Raw State）。托管状态就是由Flink统一管理的，状态的存储访问、故障恢复和重组等一系列问题都由Flink实现，我们只要调接口就可以；而原始状态则是自定义的，相当于就是开辟了一块内存，需要我们自己管理，实现状态的序列化和故障恢复。通常我们采用Flink托管状态来实现需求。

案例用到的测试数据请参考文章：
Flink自定义Source模拟数据流
原文链接：https://blog.csdn.net/m0_52606060/article/details/135436048

在这里插入图片描述

Flink的状态有两种：托管状态（Managed State）和原始状态（Raw State）。托管状态就是由Flink统一管理的，状态的存储访问、故障恢复和重组等一系列问题都由Flink实现，我们只要调接口就可以；而原始状态则是自定义的，相当于就是开辟了一块内存，需要我们自己管理，实现状态的序列化和故障恢复。
通常我们采用Flink托管状态来实现需求。

接下来我们的重点就是托管状态（Managed State）。
我们知道在Flink中，一个算子任务会按照并行度分为多个并行子任务执行，而不同的子任务会占据不同的任务槽（task slot）。由于不同的slot在计算资源上是物理隔离的，所以Flink能管理的状态在并行任务间是无法共享的，每个状态只能针对当前子任务的实例有效。
而很多有状态的操作（比如聚合、窗口）都是要先做keyBy进行按键分区的。按键分区之后，任务所进行的所有计算都应该只针对当前key有效，所以状态也应该按照key彼此隔离。在这种情况下，状态的访问方式又会有所不同。
基于这样的想法，我们又可以将托管状态分为两类：算子状态和按键分区状态。

在这里插入图片描述

在这里插入图片描述
另外，也可以通过富函数类（Rich Function）来自定义Keyed State，所以只要提供了富函数类接口的算子，也都可以使用Keyed State。所以即使是map、filter这样无状态的基本转换算子，我们也可以通过富函数类给它们“追加”Keyed State。比如RichMapFunction、RichFilterFunction。在富函数中，我们可以调用.getRuntimeContext()获取当前的运行时上下文（RuntimeContext），进而获取到访问状态的句柄；这种富函数中自定义的状态也是Keyed State。从这个角度讲，Flink中所有的算子都可以是有状态的。
无论是Keyed State还是Operator State，它们都是在本地实例上维护的，也就是说每个并行子任务维护着对应的状态，算子的子任务之间状态不共享。

public interface ValueState<T> extends State {
    T value() throws IOException;
    void update(T value) throws IOException;
}

T value()：获取当前状态的值；
update(T value)：对状态进行更新，传入的参数value就是要覆写的状态值。

public ValueStateDescriptor(String name, Class<T> typeClass) {
    super(name, typeClass, null);
}


import com.zxl.bean.Orders;
import com.zxl.datas.OrdersData;
import org.apache.flink.api.common.eventtime.WatermarkStrategy;
import org.apache.flink.api.common.state.ValueState;
import org.apache.flink.api.common.state.ValueStateDescriptor;
import org.apache.flink.api.common.typeinfo.Types;
import org.apache.flink.configuration.Configuration;
import org.apache.flink.streaming.api.TimeCharacteristic;
import org.apache.flink.streaming.api.datastream.DataStreamSource;
import org.apache.flink.streaming.api.datastream.SingleOutputStreamOperator;
import org.apache.flink.streaming.api.environment.StreamExecutionEnvironment;
import org.apache.flink.streaming.api.functions.KeyedProcessFunction;
import org.apache.flink.util.Collector;

import java.time.Duration;

public class KeyedValueStateDemo {
    public static void main(String[] args) throws Exception {
        // TODO: 2024/1/15  创建Flink流处理执行环境
        StreamExecutionEnvironment environment = StreamExecutionEnvironment.getExecutionEnvironment();
        // TODO: 2024/1/15  设置并行度为1
        environment.setParallelism(1);
        // TODO: 2024/1/7 定义时间语义
        environment.setStreamTimeCharacteristic(TimeCharacteristic.EventTime);
        // TODO: 2024/1/6 订单数据
        DataStreamSource<Orders> ordersDataStreamSource = environment.addSource(new OrdersData());
        // TODO: 2024/1/15 设置水位线
        WatermarkStrategy<Orders> watermarkStrategy = WatermarkStrategy
                // TODO: 2024/1/15 设置最大乱序程度，数据流中乱序数据时间戳的最大差值
                .<Orders>forBoundedOutOfOrderness(Duration.ofSeconds(3))
                // TODO: 2024/1/15 指定水位线中对应的时间字段
                .withTimestampAssigner((orders, l) -> orders.getOrder_date())
                // TODO: 2024/1/15 设置空闲等待时间，如果某个分区中有长时间无数据产生将放弃此分区的水位线选举权力
                .withIdleness(Duration.ofSeconds(3));
        // TODO: 2024/1/15 添加水位线
        SingleOutputStreamOperator<Orders> operator = ordersDataStreamSource.assignTimestampsAndWatermarks(watermarkStrategy);
        SingleOutputStreamOperator<String> streamOperator = operator.keyBy(orders -> orders.getProduct_id())
                .process(new KeyedProcessFunction<Integer, Orders, String>() {

                    // TODO 1.定义状态
                    ValueState<Integer> lastVcState;

                    @Override
                    public void open(Configuration parameters) throws Exception {
                        super.open(parameters);
                        // TODO 2.在open方法中，初始化状态
                        // 状态描述器两个参数：第一个参数，起个名字，不重复；第二个参数，存储的类型
                        lastVcState = getRuntimeContext().getState(new ValueStateDescriptor<Integer>("lastVcState", Types.INT));
                    }

                    @Override
                    public void processElement(Orders orders, KeyedProcessFunction<Integer, Orders, String>.Context context, Collector<String> out) throws Exception {
                        //lastVcState.value();  // 取出 本组 值状态 的数据
                        //lastVcState.update(); // 更新 本组 值状态 的数据
                        //lastVcState.clear();  // 清除 本组 值状态 的数据

                        // 1. 取出上一条数据的水位值(Integer默认值是null，判断)
                        int lastVc = lastVcState.value() == null ? 0 : lastVcState.value();
                        // 2. 求差值的绝对值，判断是否超过10
                        Integer vc = orders.getOrder_amount();
                        if (Math.abs(vc - lastVc) > 10) {
                            out.collect("传感器=" + orders.getProduct_id() + "==>当前商品最大销售额=" + vc + ",与上一次记录=" + lastVc + ",相差超过10！！！！");
                        }
                        // 3. 更新状态里的水位值
                        lastVcState.update(vc);
                    }
                });
        ordersDataStreamSource.print();
        streamOperator.print();
        environment.execute();
    }
}

Iterable<T> get()：获取当前的列表状态，返回的是一个可迭代类型Iterable<T>；
update(List<T> values)：传入一个列表values，直接对状态进行覆盖；
add(T value)：在状态列表中添加一个元素value；
addAll(List<T> values)：向列表中添加多个元素，以列表values形式传入。

package com.zxl.state;

import com.zxl.bean.Orders;
import com.zxl.datas.OrdersData;
import org.apache.flink.api.common.eventtime.WatermarkStrategy;
import org.apache.flink.api.common.state.ListState;
import org.apache.flink.api.common.state.ListStateDescriptor;
import org.apache.flink.api.common.typeinfo.Types;
import org.apache.flink.configuration.Configuration;
import org.apache.flink.streaming.api.TimeCharacteristic;
import org.apache.flink.streaming.api.datastream.DataStreamSource;
import org.apache.flink.streaming.api.datastream.SingleOutputStreamOperator;
import org.apache.flink.streaming.api.environment.StreamExecutionEnvironment;
import org.apache.flink.streaming.api.functions.KeyedProcessFunction;
import org.apache.flink.util.Collector;

import java.time.Duration;
import java.util.ArrayList;
import java.util.List;

public class KeyedListStateDemo {
    public static void main(String[] args) throws Exception {
        // TODO: 2024/1/15  创建Flink流处理执行环境
        StreamExecutionEnvironment environment = StreamExecutionEnvironment.getExecutionEnvironment();
        // TODO: 2024/1/15  设置并行度为1
        environment.setParallelism(1);
        // TODO: 2024/1/7 定义时间语义
        environment.setStreamTimeCharacteristic(TimeCharacteristic.EventTime);
        // TODO: 2024/1/6 订单数据
        DataStreamSource<Orders> ordersDataStreamSource = environment.addSource(new OrdersData());
        // TODO: 2024/1/15 设置水位线
        WatermarkStrategy<Orders> watermarkStrategy = WatermarkStrategy
                // TODO: 2024/1/15 设置最大乱序程度，数据流中乱序数据时间戳的最大差值
                .<Orders>forBoundedOutOfOrderness(Duration.ofSeconds(3))
                // TODO: 2024/1/15 指定水位线中对应的时间字段
                .withTimestampAssigner((orders, l) -> orders.getOrder_date())
                // TODO: 2024/1/15 设置空闲等待时间，如果某个分区中有长时间无数据产生将放弃此分区的水位线选举权力
                .withIdleness(Duration.ofSeconds(3));
        // TODO: 2024/1/15 添加水位线
        SingleOutputStreamOperator<Orders> operator = ordersDataStreamSource.assignTimestampsAndWatermarks(watermarkStrategy);
        SingleOutputStreamOperator<String> streamOperator = operator.keyBy(orders -> orders.getProduct_id())
                .process(new KeyedProcessFunction<Integer, Orders, String>() {

                    // TODO 1.定义状态
                    ListState<Integer> vcListState;

                    @Override
                    public void open(Configuration parameters) throws Exception {
                        super.open(parameters);
                        // TODO 2.在open方法中，初始化状态
                        // 状态描述器两个参数：第一个参数，起个名字，不重复；第二个参数，存储的类型
                        vcListState = getRuntimeContext().getListState(new ListStateDescriptor<Integer>("vcListState", Types.INT));
                    }

                    @Override
                    public void processElement(Orders orders, KeyedProcessFunction<Integer, Orders, String>.Context context, Collector<String> out) throws Exception {
                        // 1.来一条，存到list状态里
                        vcListState.add(orders.getOrder_amount());

                        // 2.从list状态拿出来(Iterable)， 拷贝到一个List中，排序， 只留3个最大的
                        Iterable<Integer> vcListIt = vcListState.get();
                        // 2.1 拷贝到List中
                        List<Integer> vcList = new ArrayList<>();
                        for (Integer vc : vcListIt) {
                            vcList.add(vc);
                        }
                        // 2.2 对List进行降序排序
                        vcList.sort((o1, o2) -> o2 - o1);
                        // 2.3 只保留最大的3个(list中的个数一定是连续变大，一超过3就立即清理即可)
                        if (vcList.size() > 3) {
                            // 将最后一个元素清除（第4个）
                            vcList.remove(3);
                        }

                        out.collect("传感器id为" + orders.getProduct_id() + ",最大的3个水位值=" + vcList.toString());

                        // 3.更新list状态
                        vcListState.update(vcList);


                        // vcListState.get();            //取出 list状态 本组的数据，是一个Iterable
                        // vcListState.add();            // 向 list状态 本组 添加一个元素
                        // vcListState.addAll();         // 向 list状态 本组 添加多个元素
                        // vcListState.update();         // 更新 list状态 本组数据（覆盖）
                        // vcListState.clear();          // 清空List状态 本组数据
                    }
                });
        ordersDataStreamSource.print();
        streamOperator.print();
        environment.execute();
    }
}

UV get(UK key)：传入一个key作为参数，查询对应的value值；
put(UK key, UV value)：传入一个键值对，更新key对应的value值；
putAll(Map<UK, UV> map)：将传入的映射map中所有的键值对，全部添加到映射状态中；
remove(UK key)：将指定key对应的键值对删除；
boolean contains(UK key)：判断是否存在指定的key，返回一个boolean值。
另外，MapState也提供了获取整个映射相关信息的方法；
Iterable<Map.Entry<UK, UV>> entries()：获取映射状态中所有的键值对；
Iterable<UK> keys()：获取映射状态中所有的键（key），返回一个可迭代Iterable类型；
Iterable<UV> values()：获取映射状态中所有的值（value），返回一个可迭代Iterable类型；
boolean isEmpty()：判断映射是否为空，返回一个boolean值。

package com.zxl.state;

import com.zxl.bean.Orders;
import com.zxl.datas.OrdersData;
import org.apache.flink.api.common.eventtime.WatermarkStrategy;
import org.apache.flink.api.common.state.MapState;
import org.apache.flink.api.common.state.MapStateDescriptor;
import org.apache.flink.api.common.typeinfo.Types;
import org.apache.flink.configuration.Configuration;
import org.apache.flink.streaming.api.TimeCharacteristic;
import org.apache.flink.streaming.api.datastream.DataStreamSource;
import org.apache.flink.streaming.api.datastream.SingleOutputStreamOperator;
import org.apache.flink.streaming.api.environment.StreamExecutionEnvironment;
import org.apache.flink.streaming.api.functions.KeyedProcessFunction;
import org.apache.flink.util.Collector;

import java.time.Duration;
import java.util.Map;

public class KeyedMapStateDemo {
    public static void main(String[] args) throws Exception {
        // TODO: 2024/1/15  创建Flink流处理执行环境
        StreamExecutionEnvironment environment = StreamExecutionEnvironment.getExecutionEnvironment();
        // TODO: 2024/1/15  设置并行度为1
        environment.setParallelism(1);
        // TODO: 2024/1/7 定义时间语义
        environment.setStreamTimeCharacteristic(TimeCharacteristic.EventTime);
        // TODO: 2024/1/6 订单数据
        DataStreamSource<Orders> ordersDataStreamSource = environment.addSource(new OrdersData());
        // TODO: 2024/1/15 设置水位线
        WatermarkStrategy<Orders> watermarkStrategy = WatermarkStrategy
                // TODO: 2024/1/15 设置最大乱序程度，数据流中乱序数据时间戳的最大差值
                .<Orders>forBoundedOutOfOrderness(Duration.ofSeconds(3))
                // TODO: 2024/1/15 指定水位线中对应的时间字段
                .withTimestampAssigner((orders, l) -> orders.getOrder_date())
                // TODO: 2024/1/15 设置空闲等待时间，如果某个分区中有长时间无数据产生将放弃此分区的水位线选举权力
                .withIdleness(Duration.ofSeconds(3));
        // TODO: 2024/1/15 添加水位线
        SingleOutputStreamOperator<Orders> operator = ordersDataStreamSource.assignTimestampsAndWatermarks(watermarkStrategy);
        SingleOutputStreamOperator<String> streamOperator = operator.keyBy(orders -> orders.getProduct_id())
                .process(new KeyedProcessFunction<Integer, Orders, String>() {

                    // TODO 1.定义状态
                    MapState<Integer, Integer> vcCountMapState;

                    @Override
                    public void open(Configuration parameters) throws Exception {
                        super.open(parameters);
                        // TODO 2.在open方法中，初始化状态
                        // 状态描述器两个参数：第一个参数，起个名字，不重复；第二个参数，存储的类型
                        vcCountMapState = getRuntimeContext().getMapState(new MapStateDescriptor<Integer, Integer>("vcCountMapState", Types.INT, Types.INT));
                    }

                    @Override
                    public void processElement(Orders orders, KeyedProcessFunction<Integer, Orders, String>.Context context, Collector<String> out) throws Exception {
                        // 1.判断是否存在vc对应的key
                        Integer vc = orders.getProduct_id();
                        if (vcCountMapState.contains(vc)) {
                            // 1.1 如果包含这个vc的key，直接对value+1
                            Integer count = vcCountMapState.get(vc);
                            vcCountMapState.put(vc, ++count);
                        } else {
                            // 1.2 如果不包含这个vc的key，初始化put进去
                            vcCountMapState.put(vc, 1);
                        }

                        // 2.遍历Map状态，输出每个k-v的值
                        StringBuilder outStr = new StringBuilder();
                        outStr.append("======================================n");
                        outStr.append("传感器id为" + orders.getProduct_id() + "n");
                        for (Map.Entry<Integer, Integer> vcCount : vcCountMapState.entries()) {
                            outStr.append(vcCount.toString() + "n");
                        }
                        outStr.append("======================================n");
                        out.collect(outStr.toString());


//                                vcCountMapState.get();          // 对本组的Map状态，根据key，获取value
//                                vcCountMapState.contains();     // 对本组的Map状态，判断key是否存在
//                                vcCountMapState.put(, );        // 对本组的Map状态，添加一个 键值对
//                                vcCountMapState.putAll();  // 对本组的Map状态，添加多个 键值对
//                                vcCountMapState.entries();      // 对本组的Map状态，获取所有键值对
//                                vcCountMapState.keys();         // 对本组的Map状态，获取所有键
//                                vcCountMapState.values();       // 对本组的Map状态，获取所有值
//                                vcCountMapState.remove();   // 对本组的Map状态，根据指定key，移除键值对
//                                vcCountMapState.isEmpty();      // 对本组的Map状态，判断是否为空
//                                vcCountMapState.iterator();     // 对本组的Map状态，获取迭代器
//                                vcCountMapState.clear();        // 对本组的Map状态，清空
                    }
                });
        ordersDataStreamSource.print();
        streamOperator.print();
        environment.execute();
    }
}

public ReducingStateDescriptor(
    String name, ReduceFunction<T> reduceFunction, Class<T> typeClass) {...}

package com.zxl.state;

import com.zxl.bean.Orders;
import com.zxl.datas.OrdersData;
import org.apache.flink.api.common.eventtime.WatermarkStrategy;
import org.apache.flink.api.common.state.ReducingState;
import org.apache.flink.api.common.state.ReducingStateDescriptor;
import org.apache.flink.configuration.Configuration;
import org.apache.flink.streaming.api.TimeCharacteristic;
import org.apache.flink.streaming.api.datastream.DataStreamSource;
import org.apache.flink.streaming.api.datastream.SingleOutputStreamOperator;
import org.apache.flink.streaming.api.environment.StreamExecutionEnvironment;
import org.apache.flink.streaming.api.functions.KeyedProcessFunction;
import org.apache.flink.util.Collector;

import java.time.Duration;

public class ReducingStateDemo {
    public static void main(String[] args) throws Exception {
        // TODO: 2024/1/15  创建Flink流处理执行环境
        StreamExecutionEnvironment environment = StreamExecutionEnvironment.getExecutionEnvironment();
        // TODO: 2024/1/15  设置并行度为1
        environment.setParallelism(1);
        // TODO: 2024/1/7 定义时间语义
        environment.setStreamTimeCharacteristic(TimeCharacteristic.EventTime);
        // TODO: 2024/1/6 订单数据
        DataStreamSource<Orders> ordersDataStreamSource = environment.addSource(new OrdersData());
        // TODO: 2024/1/15 设置水位线
        WatermarkStrategy<Orders> watermarkStrategy = WatermarkStrategy
                // TODO: 2024/1/15 设置最大乱序程度，数据流中乱序数据时间戳的最大差值
                .<Orders>forBoundedOutOfOrderness(Duration.ofSeconds(3))
                // TODO: 2024/1/15 指定水位线中对应的时间字段
                .withTimestampAssigner((orders, l) -> orders.getOrder_date())
                // TODO: 2024/1/15 设置空闲等待时间，如果某个分区中有长时间无数据产生将放弃此分区的水位线选举权力
                .withIdleness(Duration.ofSeconds(3));
        // TODO: 2024/1/15 添加水位线
        SingleOutputStreamOperator<Orders> operator = ordersDataStreamSource.assignTimestampsAndWatermarks(watermarkStrategy);
        SingleOutputStreamOperator<String> streamOperator = operator.keyBy(orders -> orders.getProduct_id())
                .process(new KeyedProcessFunction<Integer, Orders, String>() {

                    // TODO 1.定义状态
                    private ReducingState<Integer> sumVcState;

                    @Override
                    public void open(Configuration parameters) throws Exception {
                        super.open(parameters);
                        // TODO 2.在open方法中，初始化状态
                        // 状态描述器两个参数：第一个参数，起个名字，不重复；第二个参数，存储的类型
                        sumVcState = this
                                .getRuntimeContext()
                                .getReducingState(new ReducingStateDescriptor<Integer>("sumVcState", Integer::sum, Integer.class));
                    }

                    @Override
                    public void processElement(Orders orders, KeyedProcessFunction<Integer, Orders, String>.Context context, Collector<String> out) throws Exception {
                        sumVcState.add(orders.getOrder_amount());
                        out.collect(sumVcState.get().toString());
                    }
                });
        ordersDataStreamSource.print();
        streamOperator.print();
        environment.execute();
    }
}

package com.zxl.state;

import com.zxl.bean.Orders;
import com.zxl.datas.OrdersData;
import org.apache.flink.api.common.eventtime.WatermarkStrategy;
import org.apache.flink.api.common.functions.AggregateFunction;
import org.apache.flink.api.common.state.AggregatingState;
import org.apache.flink.api.common.state.AggregatingStateDescriptor;
import org.apache.flink.api.common.state.ReducingState;
import org.apache.flink.api.common.state.ReducingStateDescriptor;
import org.apache.flink.api.common.typeinfo.Types;
import org.apache.flink.api.java.tuple.Tuple2;
import org.apache.flink.configuration.Configuration;
import org.apache.flink.streaming.api.TimeCharacteristic;
import org.apache.flink.streaming.api.datastream.DataStreamSource;
import org.apache.flink.streaming.api.datastream.SingleOutputStreamOperator;
import org.apache.flink.streaming.api.environment.StreamExecutionEnvironment;
import org.apache.flink.streaming.api.functions.KeyedProcessFunction;
import org.apache.flink.util.Collector;

import java.time.Duration;

public class KeyedAggregatingStateDemo {
    public static void main(String[] args) throws Exception {
        // TODO: 2024/1/15  创建Flink流处理执行环境
        StreamExecutionEnvironment environment = StreamExecutionEnvironment.getExecutionEnvironment();
        // TODO: 2024/1/15  设置并行度为1
        environment.setParallelism(1);
        // TODO: 2024/1/7 定义时间语义
        environment.setStreamTimeCharacteristic(TimeCharacteristic.EventTime);
        // TODO: 2024/1/6 订单数据
        DataStreamSource<Orders> ordersDataStreamSource = environment.addSource(new OrdersData());
        // TODO: 2024/1/15 设置水位线
        WatermarkStrategy<Orders> watermarkStrategy = WatermarkStrategy
                // TODO: 2024/1/15 设置最大乱序程度，数据流中乱序数据时间戳的最大差值
                .<Orders>forBoundedOutOfOrderness(Duration.ofSeconds(3))
                // TODO: 2024/1/15 指定水位线中对应的时间字段
                .withTimestampAssigner((orders, l) -> orders.getOrder_date())
                // TODO: 2024/1/15 设置空闲等待时间，如果某个分区中有长时间无数据产生将放弃此分区的水位线选举权力
                .withIdleness(Duration.ofSeconds(3));
        // TODO: 2024/1/15 添加水位线
        SingleOutputStreamOperator<Orders> operator = ordersDataStreamSource.assignTimestampsAndWatermarks(watermarkStrategy);
        SingleOutputStreamOperator<String> streamOperator = operator.keyBy(orders -> orders.getProduct_id())
                .process(new KeyedProcessFunction<Integer, Orders, String>() {

                    // TODO 1.定义状态
                    AggregatingState<Integer, Double> vcAvgAggregatingState;

                    @Override
                    public void open(Configuration parameters) throws Exception {
                        super.open(parameters);
                        // TODO 2.在open方法中，初始化状态
                        // 状态描述器两个参数：第一个参数，起个名字，不重复；第二个参数，存储的类型
                        vcAvgAggregatingState = getRuntimeContext()
                                .getAggregatingState(
                                        new AggregatingStateDescriptor<Integer, Tuple2<Integer, Integer>, Double>(
                                                "vcAvgAggregatingState",
                                                new AggregateFunction<Integer, Tuple2<Integer, Integer>, Double>() {
                                                    @Override
                                                    public Tuple2<Integer, Integer> createAccumulator() {
                                                        return Tuple2.of(0, 0);
                                                    }

                                                    @Override
                                                    public Tuple2<Integer, Integer> add(Integer value, Tuple2<Integer, Integer> accumulator) {
                                                        return Tuple2.of(accumulator.f0 + value, accumulator.f1 + 1);
                                                    }

                                                    @Override
                                                    public Double getResult(Tuple2<Integer, Integer> accumulator) {
                                                        return accumulator.f0 * 1D / accumulator.f1;
                                                    }

                                                    @Override
                                                    public Tuple2<Integer, Integer> merge(Tuple2<Integer, Integer> a, Tuple2<Integer, Integer> b) {
//                                                                return Tuple2.of(a.f0 + b.f0, a.f1 + b.f1);
                                                        return null;
                                                    }
                                                },
                                                Types.TUPLE(Types.INT, Types.INT))
                                );
                    }

                    @Override
                    public void processElement(Orders orders, KeyedProcessFunction<Integer, Orders, String>.Context context, Collector<String> out) throws Exception {
                        // 将 水位值 添加到  聚合状态中
                        vcAvgAggregatingState.add(orders.getOrder_amount());
                        // 从 聚合状态中 获取结果
                        Double vcAvg = vcAvgAggregatingState.get();

                        out.collect("传感器id为" + orders.getProduct_id() + ",平均水位值=" + vcAvg);

//                                vcAvgAggregatingState.get();    // 对 本组的聚合状态 获取结果
//                                vcAvgAggregatingState.add();    // 对 本组的聚合状态 添加数据，会自动进行聚合
//                                vcAvgAggregatingState.clear();  // 对 本组的聚合状态 清空数据
                    }
                });
        ordersDataStreamSource.print();
        streamOperator.print();
        environment.execute();
    }
}

StateTtlConfig ttlConfig = StateTtlConfig
    .newBuilder(Time.seconds(10))
    .setUpdateType(StateTtlConfig.UpdateType.OnCreateAndWrite)
    .setStateVisibility(StateTtlConfig.StateVisibility.NeverReturnExpired)
    .build();
ValueStateDescriptor<String> stateDescriptor = new ValueStateDescriptor<>("my state", String.class);
stateDescriptor.enableTimeToLive(ttlConfig);

.newBuilder()
状态TTL配置的构造器方法，必须调用，返回一个Builder之后再调用.build()方法就可以得到StateTtlConfig了。方法需要传入一个Time作为参数，这就是设定的状态生存时间。
.setUpdateType()
设置更新类型。更新类型指定了什么时候更新状态失效时间，这里的OnCreateAndWrite表示只有创建状态和更改状态（写操作）时更新失效时间。另一种类型OnReadAndWrite则表示无论读写操作都会更新失效时间，也就是只要对状态进行了访问，就表明它是活跃的，从而延长生存时间。这个配置默认为OnCreateAndWrite。
.setStateVisibility()

package com.zxl.state;

import com.zxl.bean.Orders;
import com.zxl.datas.OrdersData;
import org.apache.flink.api.common.eventtime.WatermarkStrategy;
import org.apache.flink.api.common.state.*;
import org.apache.flink.api.common.time.Time;
import org.apache.flink.api.common.typeinfo.Types;
import org.apache.flink.configuration.Configuration;
import org.apache.flink.streaming.api.TimeCharacteristic;
import org.apache.flink.streaming.api.datastream.DataStreamSource;
import org.apache.flink.streaming.api.datastream.SingleOutputStreamOperator;
import org.apache.flink.streaming.api.environment.StreamExecutionEnvironment;
import org.apache.flink.streaming.api.functions.KeyedProcessFunction;
import org.apache.flink.util.Collector;

import java.time.Duration;

public class StateTTLDemo {
    public static void main(String[] args) throws Exception {
        // TODO: 2024/1/15  创建Flink流处理执行环境
        StreamExecutionEnvironment environment = StreamExecutionEnvironment.getExecutionEnvironment();
        // TODO: 2024/1/15  设置并行度为1
        environment.setParallelism(1);
        // TODO: 2024/1/7 定义时间语义
        environment.setStreamTimeCharacteristic(TimeCharacteristic.EventTime);
        // TODO: 2024/1/6 订单数据
        DataStreamSource<Orders> ordersDataStreamSource = environment.addSource(new OrdersData());
        // TODO: 2024/1/15 设置水位线
        WatermarkStrategy<Orders> watermarkStrategy = WatermarkStrategy
                // TODO: 2024/1/15 设置最大乱序程度，数据流中乱序数据时间戳的最大差值
                .<Orders>forBoundedOutOfOrderness(Duration.ofSeconds(3))
                // TODO: 2024/1/15 指定水位线中对应的时间字段
                .withTimestampAssigner((orders, l) -> orders.getOrder_date())
                // TODO: 2024/1/15 设置空闲等待时间，如果某个分区中有长时间无数据产生将放弃此分区的水位线选举权力
                .withIdleness(Duration.ofSeconds(3));
        // TODO: 2024/1/15 添加水位线
        SingleOutputStreamOperator<Orders> operator = ordersDataStreamSource.assignTimestampsAndWatermarks(watermarkStrategy);
        SingleOutputStreamOperator<String> streamOperator = operator.keyBy(orders -> orders.getProduct_id())
                .process(new KeyedProcessFunction<Integer, Orders, String>() {

                    // TODO 1.定义状态
                    ValueState<Integer> lastVcState;

                    @Override
                    public void open(Configuration parameters) throws Exception {
                        super.open(parameters);
                        // TODO 2.在open方法中，初始化状态
                        // 状态描述器两个参数：第一个参数，起个名字，不重复；第二个参数，存储的类型
                        // TODO 1.创建 StateTtlConfig
                        StateTtlConfig stateTtlConfig = StateTtlConfig
                                .newBuilder(Time.seconds(5)) // 过期时间5s
                             // .setUpdateType(StateTtlConfig.UpdateType.OnCreateAndWrite) // 状态 创建和写入（更新） 更新 过期时间
                                .setUpdateType(StateTtlConfig.UpdateType.OnReadAndWrite) // 状态 读取、创建和写入（更新） 更新 过期时间
                                .setStateVisibility(StateTtlConfig.StateVisibility.NeverReturnExpired) // 不返回过期的状态值
                                .build();

                        // TODO 2.状态描述器 启用 TTL
                        ValueStateDescriptor<Integer> stateDescriptor = new ValueStateDescriptor<>("lastVcState", Types.INT);
                        stateDescriptor.enableTimeToLive(stateTtlConfig);
                        this.lastVcState = getRuntimeContext().getState(stateDescriptor);

                    }

                    @Override
                    public void processElement(Orders orders, KeyedProcessFunction<Integer, Orders, String>.Context context, Collector<String> out) throws Exception {
                        // 先获取状态值，打印 ==》 读取状态
                        Integer lastVc = lastVcState.value();
                        out.collect("key=" + orders.getProduct_id() + ",状态值=" + lastVc);

                        // 如果水位大于50，更新状态值 ===》 写入状态
                        if (orders.getOrder_amount() > 50) {
                            lastVcState.update(orders.getOrder_amount());
                        }
                    }
                });
        ordersDataStreamSource.print();
        streamOperator.print();
        environment.execute();
    }
}

package com.zxl.Operator;

import com.zxl.bean.Orders;
import com.zxl.datas.OrdersData;
import org.apache.flink.api.common.eventtime.WatermarkStrategy;
import org.apache.flink.api.common.functions.MapFunction;
import org.apache.flink.api.common.state.ListState;
import org.apache.flink.api.common.state.ListStateDescriptor;
import org.apache.flink.api.common.typeinfo.Types;
import org.apache.flink.runtime.state.FunctionInitializationContext;
import org.apache.flink.runtime.state.FunctionSnapshotContext;
import org.apache.flink.streaming.api.TimeCharacteristic;
import org.apache.flink.streaming.api.checkpoint.CheckpointedFunction;
import org.apache.flink.streaming.api.datastream.DataStreamSource;
import org.apache.flink.streaming.api.datastream.SingleOutputStreamOperator;
import org.apache.flink.streaming.api.environment.StreamExecutionEnvironment;

import java.time.Duration;

public class OperatorListStateDemo {
    public static void main(String[] args) throws Exception {
        // TODO: 2024/1/15  创建Flink流处理执行环境
        StreamExecutionEnvironment environment = StreamExecutionEnvironment.getExecutionEnvironment();
        // TODO: 2024/1/15  设置并行度为1
        environment.setParallelism(1);
        // TODO: 2024/1/7 定义时间语义
        environment.setStreamTimeCharacteristic(TimeCharacteristic.EventTime);
        // TODO: 2024/1/6 订单数据
        DataStreamSource<Orders> ordersDataStreamSource = environment.addSource(new OrdersData());
        // TODO: 2024/1/15 设置水位线
        WatermarkStrategy<Orders> watermarkStrategy = WatermarkStrategy
                // TODO: 2024/1/15 设置最大乱序程度，数据流中乱序数据时间戳的最大差值
                .<Orders>forBoundedOutOfOrderness(Duration.ofSeconds(3))
                // TODO: 2024/1/15 指定水位线中对应的时间字段
                .withTimestampAssigner((orders, l) -> orders.getOrder_date())
                // TODO: 2024/1/15 设置空闲等待时间，如果某个分区中有长时间无数据产生将放弃此分区的水位线选举权力
                .withIdleness(Duration.ofSeconds(3));
        // TODO: 2024/1/15 添加水位线
        SingleOutputStreamOperator<Orders> operator = ordersDataStreamSource.assignTimestampsAndWatermarks(watermarkStrategy);
        operator.map(new MyCountMapFunction()).print();
        environment.execute();

    }
    // TODO 1.实现 CheckpointedFunction 接口
    public static class MyCountMapFunction implements MapFunction<Orders, Long>, CheckpointedFunction {

        private Long count = 0L;
        private ListState<Long> state;


        @Override
        public Long map(Orders value) throws Exception {
            return ++count;
        }

        /**
         * TODO 2.本地变量持久化：将 本地变量 拷贝到 算子状态中,开启checkpoint时才会调用
         *
         * @param context
         * @throws Exception
         */
        @Override
        public void snapshotState(FunctionSnapshotContext context) throws Exception {
            System.out.println("snapshotState...");
            // 2.1 清空算子状态
            state.clear();
            // 2.2 将 本地变量 添加到 算子状态 中
            state.add(count);
        }

        /**
         * TODO 3.初始化本地变量：程序启动和恢复时， 从状态中 把数据添加到 本地变量，每个子任务调用一次
         *
         * @param context
         * @throws Exception
         */
        @Override
        public void initializeState(FunctionInitializationContext context) throws Exception {
            System.out.println("initializeState...");
            // 3.1 从 上下文 初始化 算子状态
            state = context
                    .getOperatorStateStore()
                    .getListState(new ListStateDescriptor<Long>("state", Types.LONG));

            // 3.2 从 算子状态中 把数据 拷贝到 本地变量
            if (context.isRestored()) {
                for (Long c : state.get()) {
                    count += c;
                }
            }
        }
    }
}

package com.zxl.Operator;

import com.zxl.bean.Orders;
import com.zxl.datas.OrdersData;
import org.apache.flink.api.common.eventtime.WatermarkStrategy;
import org.apache.flink.api.common.functions.MapFunction;
import org.apache.flink.api.common.state.ListState;
import org.apache.flink.api.common.state.ListStateDescriptor;
import org.apache.flink.api.common.typeinfo.Types;
import org.apache.flink.runtime.state.FunctionInitializationContext;
import org.apache.flink.runtime.state.FunctionSnapshotContext;
import org.apache.flink.streaming.api.TimeCharacteristic;
import org.apache.flink.streaming.api.checkpoint.CheckpointedFunction;
import org.apache.flink.streaming.api.datastream.DataStreamSource;
import org.apache.flink.streaming.api.datastream.SingleOutputStreamOperator;
import org.apache.flink.streaming.api.environment.StreamExecutionEnvironment;

import java.time.Duration;

public class OperatorListStateDemo {
    public static void main(String[] args) throws Exception {
        // TODO: 2024/1/15  创建Flink流处理执行环境
        StreamExecutionEnvironment environment = StreamExecutionEnvironment.getExecutionEnvironment();
        // TODO: 2024/1/15  设置并行度为1
        environment.setParallelism(1);
        // TODO: 2024/1/7 定义时间语义
        environment.setStreamTimeCharacteristic(TimeCharacteristic.EventTime);
        // TODO: 2024/1/6 订单数据
        DataStreamSource<Orders> ordersDataStreamSource = environment.addSource(new OrdersData());
        // TODO: 2024/1/15 设置水位线
        WatermarkStrategy<Orders> watermarkStrategy = WatermarkStrategy
                // TODO: 2024/1/15 设置最大乱序程度，数据流中乱序数据时间戳的最大差值
                .<Orders>forBoundedOutOfOrderness(Duration.ofSeconds(3))
                // TODO: 2024/1/15 指定水位线中对应的时间字段
                .withTimestampAssigner((orders, l) -> orders.getOrder_date())
                // TODO: 2024/1/15 设置空闲等待时间，如果某个分区中有长时间无数据产生将放弃此分区的水位线选举权力
                .withIdleness(Duration.ofSeconds(3));
        // TODO: 2024/1/15 添加水位线
        SingleOutputStreamOperator<Orders> operator = ordersDataStreamSource.assignTimestampsAndWatermarks(watermarkStrategy);
        operator.map(new MyCountMapFunction()).print();
        environment.execute();

    }
    // TODO 1.实现 CheckpointedFunction 接口
    public static class MyCountMapFunction implements MapFunction<Orders, Long>, CheckpointedFunction {

        private Long count = 0L;
        private ListState<Long> state;


        @Override
        public Long map(Orders value) throws Exception {
            return ++count;
        }

        /**
         * TODO 2.本地变量持久化：将 本地变量 拷贝到 算子状态中,开启checkpoint时才会调用
         *
         * @param context
         * @throws Exception
         */
        @Override
        public void snapshotState(FunctionSnapshotContext context) throws Exception {
            System.out.println("snapshotState...");
            // 2.1 清空算子状态
            state.clear();
            // 2.2 将 本地变量 添加到 算子状态 中
            state.add(count);
        }

        /**
         * TODO 3.初始化本地变量：程序启动和恢复时， 从状态中 把数据添加到 本地变量，每个子任务调用一次
         *
         * @param context
         * @throws Exception
         */
        @Override
        public void initializeState(FunctionInitializationContext context) throws Exception {
            System.out.println("initializeState...");
            // 3.1 从 上下文 初始化 算子状态
            state = context
                    .getOperatorStateStore()
                    // TODO: 2024/1/18 UnionListState 
                    .getUnionListState(new ListStateDescriptor<Long>("union-state", Types.LONG));

            // 3.2 从 算子状态中 把数据 拷贝到 本地变量
            if (context.isRestored()) {
                for (Long c : state.get()) {
                    count += c;
                }
            }
        }
    }
}

package com.zxl.Operator;

import com.zxl.bean.Orders;
import com.zxl.bean.Payments;
import com.zxl.datas.OrdersData;
import com.zxl.datas.PaymentData;
import org.apache.flink.api.common.state.BroadcastState;
import org.apache.flink.api.common.state.MapStateDescriptor;
import org.apache.flink.api.common.state.ReadOnlyBroadcastState;
import org.apache.flink.api.common.typeinfo.Types;
import org.apache.flink.streaming.api.datastream.BroadcastConnectedStream;
import org.apache.flink.streaming.api.datastream.BroadcastStream;
import org.apache.flink.streaming.api.datastream.DataStreamSource;
import org.apache.flink.streaming.api.environment.StreamExecutionEnvironment;
import org.apache.flink.streaming.api.functions.co.BroadcastProcessFunction;
import org.apache.flink.util.Collector;

public class OperatorBroadcastStateDemo {
    public static void main(String[] args) throws Exception {
        //创建Flink流处理执行环境
        StreamExecutionEnvironment environment = StreamExecutionEnvironment.getExecutionEnvironment();
        //设置并行度为1
        environment.setParallelism(2);
        //调用Flink自定义Source
        // TODO: 2024/1/6 订单数据
        DataStreamSource<Orders> ordersDataStreamSource = environment.addSource(new OrdersData());
        ordersDataStreamSource.print();
        // TODO: 2024/1/6 支付数据
        DataStreamSource<Payments> paymentsDataStreamSource = environment.addSource(new PaymentData());
        paymentsDataStreamSource.print();
        
        // TODO 1. 将 配置流 广播
        MapStateDescriptor<String, Integer> broadcastMapState = new MapStateDescriptor<>("broadcast-state", Types.STRING, Types.INT);
        BroadcastStream<Payments> broadcast = paymentsDataStreamSource.broadcast(broadcastMapState);

        // TODO 2.把 数据流 和 广播后的配置流 connect
        BroadcastConnectedStream<Orders, Payments> connectedStream = ordersDataStreamSource.connect(broadcast);

        // TODO 3.调用 process
        connectedStream
                .process(new BroadcastProcessFunction<Orders, Payments, String>() {

                    // TODO: 2024/1/18 数据流的处理方法： 数据流 只能 读取 广播状态，不能修改
                    @Override
                    public void processElement(Orders orders, BroadcastProcessFunction<Orders, Payments, String>.ReadOnlyContext ctx, Collector<String> out) throws Exception {
                        // TODO 5.通过上下文获取广播状态，取出里面的值（只读，不能修改）
                        ReadOnlyBroadcastState<String, Integer> broadcastState = ctx.getBroadcastState(broadcastMapState);
                        Integer threshold = broadcastState.get("threshold");
                        // 判断广播状态里是否有数据，因为刚启动时，可能是数据流的第一条数据先来
                        threshold = (threshold == null ? 0 : threshold);
                        if (orders.getOrder_amount() > threshold) {
                            out.collect(orders.getOrder_amount() + ",水位超过指定的阈值：" + threshold + "!!!");
                        }
                    }

                    // TODO: 2024/1/18 广播后的配置流的处理方法:  只有广播流才能修改 广播状态

                    @Override
                    public void processBroadcastElement(Payments payments, BroadcastProcessFunction<Orders, Payments, String>.Context ctx, Collector<String> collector) throws Exception {
                        // TODO 4. 通过上下文获取广播状态，往里面写数据
                        BroadcastState<String, Integer> broadcastState = ctx.getBroadcastState(broadcastMapState);
                        broadcastState.put("threshold", payments.getPayment_amount());
                    }
                })
                .print();

        environment.execute();
    }
}

state.backend: hashmap

state.checkpoints.dir: hdfs://hadoop102:8020/flink/checkpoints

//通过执行环境设置，HashMapStateBackend。
StreamExecutionEnvironment env = StreamExecutionEnvironment.getExecutionEnvironment();
env.setStateBackend(new HashMapStateBackend());
//通过执行环境设置，EmbeddedRocksDBStateBackend。
StreamExecutionEnvironment env = StreamExecutionEnvironment.getExecutionEnvironment();
env.setStateBackend(new EmbeddedRocksDBStateBackend());

<dependency>
    <groupId>org.apache.flink</groupId>
    <artifactId>flink-statebackend-rocksdb</artifactId>
    <version>${flink.version}</version>
</dependency>

 		// TODO: 2024/1/18  创建Flink流处理执行环境
        StreamExecutionEnvironment environment = StreamExecutionEnvironment.getExecutionEnvironment();
        // TODO: 2024/1/18 配置状态后端 
        environment.setStateBackend(new RocksDBStateBackend("file:///E:/FlinkWorks/FlinkJoin/src/main/resources"));
        // TODO: 2024/1/18   每隔2秒启动一次检查点保存
        environment.enableCheckpointing(2000);

显示所有内容

声明：本站所有文章，如无特殊说明或标注，均为本站原创发布。任何个人或组织，在未征得本站同意时，禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。如若本站内容侵犯了原著者的合法权益，可联系我们进行处理。

Flink中的状态

概述

有状态的算子

状态的分类

托管状态（Managed State）和原始状态（Raw State）

算子状态（Operator State）和按键分区状态（Keyed State）

算子状态

按键分区状态

按键分区状态（Keyed State）

值状态（ValueState）

列表状态（ListState）

Map状态（MapState）

归约状态（ReducingState）

聚合状态（AggregatingState）

状态生存时间（TTL）

算子状态（Operator State）

列表状态（ListState）

联合列表状态（UnionListState）

广播状态（BroadcastState）

状态后端（State Backends）

状态后端的分类（HashMapStateBackend/RocksDB）

哈希表状态后端（HashMapStateBackend）

内嵌RocksDB状态后端（EmbeddedRocksDBStateBackend）

如何选择正确的状态后端

状态后端的配置

配置默认的状态后端

默认状态后端

存放检查点的文件路径

为每个作业（Per-job/Application）单独配置状态后端

发表回复取消回复

Flink中的状态

概述

有状态的算子

状态的分类

托管状态（Managed State）和原始状态（Raw State）

算子状态（Operator State）和按键分区状态（Keyed State）

算子状态

按键分区状态

按键分区状态（Keyed State）

值状态（ValueState）

列表状态（ListState）

Map状态（MapState）

归约状态（ReducingState）

聚合状态（AggregatingState）

状态生存时间（TTL）

算子状态（Operator State）

列表状态（ListState）

联合列表状态（UnionListState）

广播状态（BroadcastState）

状态后端（State Backends）

状态后端的分类（HashMapStateBackend/RocksDB）

哈希表状态后端（HashMapStateBackend）

内嵌RocksDB状态后端（EmbeddedRocksDBStateBackend）

如何选择正确的状态后端

状态后端的配置

配置默认的状态后端

默认状态后端

存放检查点的文件路径

为每个作业（Per-job/Application）单独配置状态后端

相关文章

发表回复 取消回复

发表回复取消回复