MySQL 一直以来都支持正则匹配,不过对于正则替换则一直到MySQL 8.0 才支持。对于这类场景,以前要么在MySQL端处理,要么把数据拿出来在应用端处理。
比如我想把表y1的列str1的出现第3个action的子 串替换成dble,怎么实现?
1. 自己写SQL层的存储函数。代码如下写死了3个,没有优化,仅仅作为演示,MySQL 里非常不建议写这样的函数。
mysql
DELIMITER $$
USE `ytt`$$
DROP FUNCTION IF EXISTS `func_instr_simple_ytt`$$
CREATE DEFINER=`root`@`localhost` FUNCTION `func_instr_simple_ytt`(
f_str VARCHAR(1000), -- Parameter 1
f_substr VARCHAR(100), -- Parameter 2
f_replace_str varchar(100),
f_times int -- times counter.only support 3.
) RETURNS varchar(1000)
BEGIN
declare v_result varchar(1000) default 'ytt'-- result.
declare v_substr_len int default 0-- search string length.
set f_times = 3-- only support 3.
set v_substr_len = length(f_substr)
select instr(f_str,f_substr) into @p1-- First real position .
select instr(substr(f_str,@p1+v_substr_len),f_substr) into @p2Secondary virtual position.
select instr(substr(f_str,@p2+ @p1 +2*v_substr_len - 1),f_substr) into @p3-- Third virtual position.
if @p1 >0 &&@p2 >0 &&@p3 >0 then -- Fine.
select
concat(substr(f_str,1,@p1 + @p2 + @p3 + (f_times - 1) * v_substr_len - f_times)
,f_replace_str,
substr(f_str,@p1 + @p2 + @p3 + f_times * v_substr_len-2)) into v_result
else
set v_result = f_str-- Never changed.
end if
-- Purge all session variables.
set @p1 = null
set @p2 = null
set @p3 = null
return v_result
end
$$
DELIMITER
-- 调用函数来更新:
mysql>update y1 set str1 = func_instr_simple_ytt(str1,'action','dble',3)
Query OK, 20 rows affected (0.12 sec)
Rows matched: 20 Changed: 20 Warnings: 0
2. 导出来用sed之类的工具替换掉在导入,步骤如下:(推荐使用)
1)导出表y1的记录。
mysqlmysql>select * from y1 into outfile '/var/lib/mysql-files/y1.csv'Query OK, 20 rows affected (0.00 sec)
2)用sed替换导出来的数据。
shellroot@ytt-Aspire-V5-471G:/var/lib/mysql-files# sed -i 's/action/dble/3' y1.csv
3)再次导入处理好的数据,完成。
mysql
mysql>truncate y1
Query OK, 0 rows affected (0.99 sec)
mysql>load data infile '/var/lib/mysql-files/y1.csv' into table y1
Query OK, 20 rows affected (0.14 sec)
Records: 20 Deleted: 0 Skipped: 0 Warnings: 0
以上两种还是推荐导出来处理好了再重新导入,性能来的高些,而且还不用自己费劲写函数代码。
那MySQL 8.0 对于以上的场景实现就非常简单了,一个函数就搞定了。
mysqlmysql>update y1 set str1 = regexp_replace(str1,'action','dble',1,3) Query OK, 20 rows affected (0.13 sec)Rows matched: 20 Changed: 20 Warnings: 0
还有一个regexp_instr 也非常有用,特别是这种特指出现第几次的场景。比如定义 SESSION 变量@a。
mysqlmysql>set @a = 'aa bb cc ee fi lucy 1 1 1 b s 2 3 4 5 2 3 5 561 19 10 10 20 30 10 40'Query OK, 0 rows affected (0.04 sec)
拿到至少两次的数字出现的第二次子串的位置。
mysqlmysql>select regexp_instr(@a,'[:digit:]{2,}',1,2)+--------------------------------------+| regexp_instr(@a,'[:digit:]{2,}',1,2) |+--------------------------------------+| 50 |+--------------------------------------+1 row in set (0.00 sec)
那我们在看看对多字节字符支持如何。
mysql
mysql>set @a = '中国 美国 俄罗斯 日本 中国 北京 上海 深圳 广州 北京 上海 武汉 东莞 北京 青岛 北京'
Query OK, 0 rows affected (0.00 sec)
mysql>select regexp_instr(@a,'北京',1,1)
+-------------------------------+
| regexp_instr(@a,'北京',1,1) |
+-------------------------------+
| 17 |
+-------------------------------+
1 row in set (0.00 sec)
mysql>select regexp_instr(@a,'北京',1,2)
+-------------------------------+
| regexp_instr(@a,'北京',1,2) |
+-------------------------------+
| 29 |
+-------------------------------+
1 row in set (0.00 sec)
mysql>select regexp_instr(@a,'北京',1,3)
+-------------------------------+
| regexp_instr(@a,'北京',1,3) |
+-------------------------------+
| 41 |
+-------------------------------+
1 row in set (0.00 sec)
那总结下,这里我提到了 MySQL 8.0 的两个最有用的正则匹配函数 regexp_replace 和 regexp_instr。针对以前类似的场景算是有一个完美的解决方案。
DB version: 5.7.25-log 和 8.0.18
1. RLIKE() 为REGEXP同义词,见下
2. REGEXP() 完整表达式 expr REGEXP pat
>如果字符串expr与模式pat指定的正则表达式匹配,则返回1,否则返回0。
>如果expr或pat为NULL,则返回值为NULL。
>正则表达式规则明细及使用案例见下方。
3. NOT REGEXP() 完整表达式 expr NOT REGEXP pat 或者 expr NOT RLIKE pat 。
与 NOT (expr REGEXP pat) 相同。
1. REGEXP_LIKE() REGEXP 和 RLIKE 是 REGEXP_LIKE() 的同义词。
使用明细见上面5.7版本 '正则表达式规则'
2. REGEXP_INSTR()完整表达式 REGEXP_INSTR(expr, pat[, pos[, occurrence[, return_option[, match_type]]]])
>返回与模式 pat 指定的正则表达式匹配的字符串 expr 的子字符串的起始索引,如果没有匹配则为0。
>如果 expr 或 pat 为NULL,则返回值为NULL。字符索引从1开始。
完整表达式各参数含义:
pos : 从 expr 的 pos 位置开始搜索,默认为1;
occurrence : 返回第 occurrence 个匹配的子字符串,默认为1;
return_option : 返回类型,如果为0,则返回匹配到的子字符串的第一个字符的位置,如果为1,则返回匹配到的子字符串最后一个字符的位置+1,默认为0;
match_type : 匹配类型,包含以下值,可同时使用一个或多个;
如果在match_type中指定了矛盾选项的字符,则以最右边的字符为准。
3. REGEXP_REPLACE()完整表达式 REGEXP_REPLACE(expr, pat, repl[, pos[, occurrence[, match_type]]])
>用替换字符串 repl 替换字符串 expr 中与模式 pat 指定的正则表达式匹配的匹配项,并返回结果字符串。
>如果expr,pat或repl为NULL,则返回值为NULL
pos , occurrence , match_type 参数含义见 REGEXP_INSTR()
4. REGEXP_SUBSTR()完整表达式 REGEXP_SUBSTR(expr, pat[, pos[, occurrence[, match_type]]])
>返回与模式 pat 指定的正则表达式匹配的字符串 expr 的子字符串;如果不匹配,则返回NULL。
>如果expr或pat为NULL,则返回值为NULL。
pos , occurrence , match_type 参数含义见 REGEXP_INSTR()
代码如下:CREATE PROCEDURE sp_str
(
IN p_str VARCHAR(50), /*原始字符串*/
IN p_begin_str VARCHAR(50), /*要匹配的起始字符串*/
IN p_end_str VARCHAR(50)) /*要匹配的结束字符串*/
OUT p_result VARCHAR(50)) /*返回结果*/
NOT DETERMINISTIC
SQL SECURITY DEFINER
COMMENT ''
BEGIN
DECLARE m_len INT DEFAULT 0
DECLARE m_index INT DEFAULT 0
/*计算第一个匹配字符串的索引位置*/
select locate(p_begin_str,p_str)+char_length(p_begin_str) into m_index
/*计算第一个匹配字符串的长度*/
select locate(p_end_str,p_str,m_index) into m_len
select SUBSTRING(p_str,m_index,m_len-m_index) INTO p_result
END
执行:
CALL sp_str('[]abcd[12345]aa[]ss','abcd[',']',@result)
返回值 @result 为12345
call sp_str('[]abcd[sdww]aa[]ss','abcd[',']',@result)
返回值 @result 为sdww
如果不用存储过程,可以直接写sql语句实现:
代码如下:
select SUBSTRING(
']abcd[12345]111[]',
locate('abcd[',']abcd[12345]111[]')+CHAR_LENGTH('abcd['),
locate(']',']abcd[12345]111[]',CHAR_LENGTH('abcd['))-
(select locate('abcd[',']abcd[12345]111[]')+CHAR_LENGTH('abcd['))
)
返回值为 12345
关于mysql的函数介绍:
CHAR_LENGTH(str)
返回字符串str的长度。
LOCATE(substr,str)
POSITION(substr IN str)
返回子串substr在字符串str第一个出现的位置,如果substr不是在str里面,返回0.
mysql>select LOCATE('bar', 'foobarbar')
->4
mysql>select LOCATE('xbar', 'foobar')
->0
该函数是多字节可靠的。 LOCATE(substr,str,pos)
返回子串substr在字符串str第一个出现的位置,从位置pos开始。如果substr不是在str里面,返回0。
mysql>select LOCATE('bar', 'foobarbar',5)
->7
这函数是多字节可靠的。
SUBSTRING(str,pos,len)
SUBSTRING(str FROM pos FOR len)
MID(str,pos,len)
从字符串str返回一个len个字符的子串,从位置pos开始。使用FROM的变种形式是ANSI SQL92语法。
mysql>select SUBSTRING('Quadratically',5,6)
->'ratica'
该函数是多字节可靠的。
SUBSTRING(str,pos)
欢迎分享,转载请注明来源:内存溢出
评论列表(0条)