apache / apache/arrow-java

[Java] DictionaryProvider leaks memory while adding dictionaries with duplicate encoding

未关闭
#313 7 条评论 0 个 reaction 已指派 0 人 在 GitHub 查看
Type: bug
主要语言
Java
星标
94
派生
152
平均合并
3 天 16 小时
30 天内合并 PR
11

描述

DictionaryProvider leaks memory while adding dictionaries with duplicate encoding. Is this expected? Should the provider release the memory of the existing dictionary vector if it accepts another one with same encoding id ?

Sample code:
```java

"dictionaryProvider" should " not leak memory while adding dictionaries with duplicate encoding" in {

val allocator: RootAllocator = new RootAllocator()

val vector: ListVector = ListVector.empty("vector", allocator)
val dictionaryVector1: ListVector = ListVector.empty("dict1", allocator)
val dictionaryVector2: ListVector = ListVector.empty("dict2", allocator)

val writer1: UnionListWriter = vector.getWriter
writer1.allocate
writer1.setValueCount(1)

val dictWriter1: UnionListWriter = dictionaryVector1.getWriter
dictWriter1.allocate
dictWriter1.setValueCount(1)

val dictWriter2: UnionListWriter = dictionaryVector2.getWriter
dictWriter2.allocate
dictWriter2.setValueCount(1)

val dictionary1: Dictionary = new Dictionary(dictionaryVector1, new DictionaryEncoding(1L, false, None.orNull))
val dictionary2: Dictionary = new Dictionary(dictionaryVector2, new DictionaryEncoding(1L, false, None.orNull))

val provider = new DictionaryProvider.MapDictionaryProvider
provider.put(dictionary1)
provider.put(dictionary2)

vector.clear()
provider.getDictionaryIds.asScala.map(id => provider.lookup(id).getVector.clear())

allocator.getAllocatedMemory shouldBe 0
}
```

**Reporter**: [Vimal Varghese](https://issues.apache.org/jira/browse/ARROW-16920)

**Note**: *This issue was originally created as [ARROW-16920](https://issues.apache.org/jira/browse/ARROW-16920). Please see the [migration documentation](https://github.com/apache/arrow/issues/14542) for further details.*

贡献指南

打开贡献指南

调研方向

从 DictionaryProvider.MapDictionaryProvider 开始,运行提供的复现步骤:添加两个 encoding ID 为 1 的字典,清空 vector,并检查 allocator 内存。跟踪插入第二个字典时第一个字典发生了什么;完成标准是重复 encoding 的情况释放所有已分配的内存,并且最终的分配检查达到零。

由索引模型根据 Issue 内容生成。

评估

技术栈
java
领域
data
Issue 类型
缺陷
难度
3/5
预计耗时
1-2 天
活跃度
停滞
描述清晰度
基本清楚
新手友好度
35/100

把新 issue 发到你的邮箱

精选适合新手参与的 GitHub issue 摘要。