kaivalnp commented on issue #16736:
URL: https://github.com/apache/lucene/issues/16736#issuecomment-5880849664

   Full error:
   
   ```
     2> Exception from random analyzer: 
     2> charfilters=
     2>   org.apache.lucene.analysis.pattern.PatternReplaceCharFilter(a, 
<EMOJI>, java.io.StringReader@65dc460a)
     2> tokenizer=
     2>   org.apache.lucene.analysis.th.ThaiTokenizer([ntmdfoaoe, kvlhsmvsf], 
12)
     2> filters=
     2>   
Conditional:org.apache.lucene.analysis.no.NorwegianLightStemFilter(OneTimeWrapper@5fc5fd51
 
term=,bytes=[],startOffset=0,endOffset=0,positionIncrement=1,positionLength=1,type=word,termFrequency=1,keyword=false)
     2>   
org.apache.lucene.analysis.reverse.ReverseStringFilter(ValidatingTokenFilter@450423e9
 
term=,bytes=[],startOffset=0,endOffset=0,positionIncrement=1,positionLength=1,type=word,termFrequency=1,keyword=false,
 ⋃)
     2>   
Conditional:org.apache.lucene.analysis.ja.JapaneseKatakanaUppercaseFilter(OneTimeWrapper@4a6c67ee
 
term=,bytes=[],startOffset=0,endOffset=0,positionIncrement=1,positionLength=1,type=word,termFrequency=1,keyword=false)
     2>   
Conditional:org.apache.lucene.analysis.es.SpanishPluralStemFilter(OneTimeWrapper@6f0fd71
 
term=,bytes=[],startOffset=0,endOffset=0,positionIncrement=1,positionLength=1,type=word,termFrequency=1,keyword=false)
      >     java.lang.IllegalArgumentException: offset out of bounds
      >         at 
__randomizedtesting.SeedInfo.seed([16A00040C8434B07:2B4129218F5156C7]:0)
      >         at 
java.base/sun.text.RuleBasedBreakIterator.checkOffset(RuleBasedBreakIterator.java:716)
      >         at 
java.base/sun.text.DictionaryBasedBreakIterator.following(DictionaryBasedBreakIterator.java:244)
      >         at 
[email protected]/org.apache.lucene.analysis.th.ThaiTokenizer.incrementWord(ThaiTokenizer.java:198)
      >         at 
[email protected]/org.apache.lucene.analysis.util.SegmentingTokenizerBase.incrementSentence(SegmentingTokenizerBase.java:204)
      >         at 
[email protected]/org.apache.lucene.analysis.util.SegmentingTokenizerBase.incrementToken(SegmentingTokenizerBase.java:100)
      >         at 
[email protected]/org.apache.lucene.tests.analysis.ValidatingTokenFilter.incrementToken(ValidatingTokenFilter.java:81)
      >         at 
[email protected]/org.apache.lucene.analysis.miscellaneous.ConditionalTokenFilter.incrementToken(ConditionalTokenFilter.java:173)
      >         at 
[email protected]/org.apache.lucene.tests.analysis.ValidatingTokenFilter.incrementToken(ValidatingTokenFilter.java:81)
      >         at 
[email protected]/org.apache.lucene.analysis.reverse.ReverseStringFilter.incrementToken(ReverseStringFilter.java:76)
      >         at 
[email protected]/org.apache.lucene.tests.analysis.ValidatingTokenFilter.incrementToken(ValidatingTokenFilter.java:81)
      >         at 
[email protected]/org.apache.lucene.analysis.miscellaneous.ConditionalTokenFilter.incrementToken(ConditionalTokenFilter.java:173)
      >         at 
[email protected]/org.apache.lucene.tests.analysis.ValidatingTokenFilter.incrementToken(ValidatingTokenFilter.java:81)
      >         at 
[email protected]/org.apache.lucene.analysis.miscellaneous.ConditionalTokenFilter.incrementToken(ConditionalTokenFilter.java:173)
      >         at 
[email protected]/org.apache.lucene.tests.analysis.ValidatingTokenFilter.incrementToken(ValidatingTokenFilter.java:81)
      >         at 
[email protected]/org.apache.lucene.tests.analysis.BaseTokenStreamTestCase.checkResetException(BaseTokenStreamTestCase.java:924)
      >         at 
[email protected]/org.apache.lucene.tests.analysis.BaseTokenStreamTestCase.checkRandomData(BaseTokenStreamTestCase.java:1064)
      >         at 
[email protected]/org.apache.lucene.analysis.tests.TestRandomChains.testRandomChains(TestRandomChains.java:941)
     2> NOTE: reproduce with: gradlew test --tests 
TestRandomChains.testRandomChains -Dtests.seed=16A00040C8434B07 
-Dtests.locale=hi-Latn -Dtests.timezone=America/Mazatlan -Dtests.asserts=true 
-Dtests.file.encoding=UTF-8
   ```
   
   Appears related to `ThaiTokenizer`, I see a recent PR at #16722


-- 
This is an automated message from the Apache Git Service.
To respond to the message, please log on to GitHub and use the
URL above to go to the specific comment.

To unsubscribe, e-mail: [email protected]

For queries about this service, please contact Infrastructure at:
[email protected]


---------------------------------------------------------------------
To unsubscribe, e-mail: [email protected]
For additional commands, e-mail: [email protected]

Reply via email to