HIVE SQL regexp

1天前 • 大数据

《平凡的世界》评分不错，《巴黎圣母院》改变成的电影不错，还有<>也蛮好看。

如何使用regexp_extract&regexp_replace函数将以上文本中所有书籍名称都提取出来？

select 	substr(
				regexp_replace(
				regexp_extract(
				regexp_replace(regexp_replace('《平凡的世界》评分不错，《巴黎圣母院》改变成的电影不错，还有<>也蛮好看。','<>','》')
				,'(.*》)',1)
				,'.*?(《[^》|^《]+》)',',$1')
			,2) as books
;

代码解析:

step1:两个regexp_replace()依次将<>规整为》；

step2:regexp_extract正则提取满足pattern=’.*》’时的值，此操作的主要目的为剔除最后一个书名号》后的文本内容

select 	
				regexp_extract(
				regexp_replace(regexp_replace('《平凡的世界》评分不错，《巴黎圣母院》改变成的电影不错，还有<>也蛮好看。','<>','》')
				,'(.*》)',1)
		
;

此时提取出来的结果为：

《平凡的世界》评分不错，《巴黎圣母院》改变成的电影不错，还有《1984》

step3:regexp_replace将书名号前边的内容替换成，

#此处的$1是指第一个小括号中的匹配结果
select 	
				regexp_replace(
				'《平凡的世界》评分不错，《巴黎圣母院》改变成的电影不错，还有《1984》'
				,'.*?(《[^》|^《]+》)',',$1')
;

此时提取出来的结果为：

,《平凡的世界》,《巴黎圣母院》,《1984》

此处需要注意的是：

*1）.正则表达式中用了非贪婪匹配.*?，如果使用贪婪匹配.*，最终返回的结果将会是

,《1984》

*2）若省去step2的操作，提取出来的结果不满足条件

select 	
				regexp_replace(
				regexp_replace(regexp_replace('《平凡的世界》评分不错，《巴黎圣母院》改变成的电影不错，还有<>也蛮好看。','<>','》')
				,'.*?(《[^》|^《]+》)',',$1')
;

此时提取出来的结果为：

,《平凡的世界》,《巴黎圣母院》,《1984》也蛮好看。

step4:substr截取除第一个逗号之外的其余内容

select substr(',《平凡的世界》,《巴黎圣母院》,《1984》',2)
;

最终提取出来的结果为：

《平凡的世界》,《巴黎圣母院》,《1984》

本文来自网络，不代表协通编程立场，如若转载，请注明出处：https://net2asp.com/9c5fe200a1.html

赞 (0)

【用三大件写出的开门烟花特效】

« 上一篇 1天前

2023高级人工智能期末总结

下一篇 » 1天前

人工智能

语义分割学习篇

part1 什么是语义分割？语义分割使图像分类任务的一种，实际上是对图片中每个像素进行分类，将相同类别的像素聚在一起从而呈现出分割的效果。主要应用于无人驾驶（以像素粒度感知周围…

1天前
人工智能

如何使用Midjourney辅助建筑平面设计和室内设计，常用的建筑平面效果图提示和使用效果展示（内附Midjourney提示词网站）

文章目录一、室内建筑平面设计 1.AutoCAD图纸（别墅图为例） 2.平面效果图 3.三维平面透视图二、建筑室内设计 1.现代简约 2.波西米亚风格 3.工业风格 4.沿海风…

1天前
人工智能

nnUNet原创团队全新力作！MedNeXt：医学图像分割新SOTA

Title：MedNeXt: Transformer-driven Scaling of ConvNets for Medical Image Segmentation MedNe…

1天前
C语言中的数组操作技巧：提升程序的效率和可读性

1. 概念数组是C语言中常见且重要的数据结构，在许多应用中都被广泛使用。合理地处理数组操作可以提高程序的效率和可读性。本文将介绍C语言中常用的数组操作方法和技巧，…

算法结构 1天前
算法结构

工业物联网网关如何实现工业设备的远程运维？-天拓四方

随着工业4.0和智能制造的快速发展，工业设备的远程运维已经成为提高企业生产效率和降低运营成本的重要手段。工业物联网网关作为这一过程中的关键组件，发挥着不可或缺的作用。本文将重点探讨…

1天前
算法结构

Windows10更新失败错误 0x80070643、KB5034441的解决方法之二

Windows10更新失败错误 0x80070643、KB5034441 在知乎Windows10更新失败错误 0x80070643、KB5034441的原因分析和几个解决方法…

1天前
算法结构

Edge浏览器进入csdn的网址出现“你的连接不是专用连接”错误

文章目录问题描述解决方案问题描述 Edge浏览器出现无法打开网页，出现：你的连接不是专用连接错误。解决方案很有可能是DNS的问题，进入浏览器的设置页面，通过以下方式选择…

1天前
算法结构

C语言经典算法实例7：完数

C语言经典算法实例7：完数一、问题描述 1.1、什么是完数 1.2、完数定义 1.3、本文的问题描述二、算法实例编译环境三、算法实例实现过程 3.1、包含头文件 3.2、声明…

1天前
算法结构

Pid算法总结笔记（平衡小车部分）

Pid的三种形式，直立环，速度环，转向环，这三种环代表了小车的三种不同动作，直立，转向，和运行速度，三种不同的构造，三种不同的控制函数，最终的思想都是通过pid算法来控制。一.P…

1天前
算法结构

C语言数组及排序算法

数组类型说明符数组名[ 常量表达式 ]; 例 float s[100]; 定义了一个浮点型数组数组名为 s ，此数组有100个元素 [ ]括号内常量表达式应为非0无符号整…

1天前