У меня есть строка с множеством специальных символов. Я хочу удалить все это, но сохранить буквы алфавита.
Как я могу это сделать?
Ответы:
Это зависит от того, что вы имеете в виду. Если вы просто хотите избавиться от них, сделайте следующее:
(Обновление: по-видимому, вы также хотите сохранить цифры, в этом случае используйте вторые строки)
String alphaOnly = input.replaceAll("[^a-zA-Z]+","");
String alphaAndDigits = input.replaceAll("[^a-zA-Z0-9]+","");
или эквивалент:
String alphaOnly = input.replaceAll("[^\\p{Alpha}]+","");
String alphaAndDigits = input.replaceAll("[^\\p{Alpha}\\p{Digit}]+","");
(Все это можно значительно улучшить, предварительно скомпилировав шаблон регулярного выражения и сохранив его в константе)
Или с Гуавой :
private static final CharMatcher ALNUM =
CharMatcher.inRange('a', 'z').or(CharMatcher.inRange('A', 'Z'))
.or(CharMatcher.inRange('0', '9')).precomputed();
// ...
String alphaAndDigits = ALNUM.retainFrom(input);
Но если вы хотите превратить акцентированные символы во что-то разумное, все еще в формате ascii, взгляните на эти вопросы:
Я использую это.
s = s.replaceAll("\\W", "");
Он заменяет все специальные символы из строки.
Вот
\ w: словесный символ, сокращение от [a-zA-Z_0-9]
\ W: символ, не являющийся словом
Вы можете использовать следующий метод, чтобы сохранить буквенно-цифровые символы.
replaceAll("[^a-zA-Z0-9]", "");
И если вы хотите сохранить только алфавитные символы, используйте это
replaceAll("[^a-zA-Z]", "");
replaceAll("[^a-zA-Z0-9 ]", "");
Замените любые специальные символы на
replaceAll("\\your special character","new character");
пример: заменить все вхождения * пробелом
replaceAll("\\*","");
* этот оператор может заменять только один тип специальных символов за раз
string Output = Regex.Replace(Input, @"([ a-zA-Z0-9&, _]|^\s)", "");
Здесь заменяются все специальные символы, кроме пробела, запятой и амперсанда. Вы также можете опустить пробел, запятую и амперсанд в следующем регулярном выражении.
string Output = Regex.Replace(Input, @"([ a-zA-Z0-9_]|^\s)", "");
Где Input - это строка, в которой нам нужно заменить символы.
Следуя примеру ответа Анджея Дойла , я думаю, что лучшим решением будет использовать org.apache.commons.lang3.StringUtils.stripAccents():
package bla.bla.utility;
import org.apache.commons.lang3.StringUtils;
public class UriUtility {
public static String normalizeUri(String s) {
String r = StringUtils.stripAccents(s);
r = r.replace(" ", "_");
r = r.replaceAll("[^\\.A-Za-z0-9_]", "");
return r;
}
}
Вы можете использовать базовые регулярные выражения для строк, чтобы найти все специальные символы, или использовать классы шаблонов и сопоставлений для поиска / изменения / удаления строк, определенных пользователем. По этой ссылке есть несколько простых и понятных примеров регулярных выражений: http://www.vogella.de/articles/JavaRegularExpressions/article.html
Вы можете получить Unicode для этого нежелательного символа из инструмента карты символов в окне ПК и добавить \ u, например, \ u00a9 для символа авторского права. Теперь вы можете использовать эту строку с этим конкретным символом нежелательной почты, не удаляя никакие символы нежелательной почты, а заменяя ее правильным Unicode.
Для пробелов используйте "[^ az AZ 0-9]" этот шаблон
let name = name.replace(/[&\/\\#,+()$~%!.„'":*‚^_¤?<>|@ª{«»§}©®™ ]/g, '').toLowerCase();