plotly / plotly/plotly.py

Sorted categories (Pandas `Categorical` series) aren't sorted in chart

Aberta
#3,802 1 comentário 1 reação 0 responsáveis Ver no GitHub

Ninguém assumiu esta issue ainda.

bug P3
Linguagem predominante
Python
Estrelas
18.8k
Forks
2.8k
Merge médio
16h 26min
PRs com merge (30d)
21

Descrição

I am plotting a chart with a pd.Categorical series on the x-axis. The category has a sort defined.

Expected behaviour: the axis is sorted as per the underlying category definition
Actual behaviour: the axis is sorted by the order of the data

df = pd.DataFrame(
    dict(
        Cost=[10, 20, 15, 2, 9],
        Rating=pd.Categorical(
            values=["High", "Low", "Medium", "Low", "Medium"],
            categories=["Low", "Medium", "High"],
            ordered=True,
        ),
    )
)

fig = px.scatter(df, x="Rating", y="Cost")

This fix would be fairly simple, I think, something like this, where series is whatever's being rendered to the xaxis (or y, or legend, etc)

if isinstance(series.dtype, pd.CategoricalDtype) and series.cat.ordered:
    fig.update_xaxes(
        categoryorder="array",
        categoryarray=series.cat.categories,
    )

Plotly version: 5.9.0.

I've noticed a number of bugs relating to pd.Categorical and pd.PeriodIndex, are there plans for better Pandas support, or is that not an area of focus?

Guia de contribuição

Abrir o guia de contribuição

Primeiros passos

  1. Leia a issue inteira e depois o guia de contribuição do projeto.
  2. Comente na issue dizendo que vai assumir — evita que duas pessoas façam o mesmo trabalho.
  3. Faça um fork do repositório e trabalhe em uma branch.
  4. Abra um pull request que referencie o número da issue.

Direção de pesquisa

Reproduza o problema com o pandas DataFrame fornecido e o ponto de entrada px.scatter(df, x="Rating", y="Cost"), depois rastreie como os valores categóricos dos eixos são tratados. Confirme que as categorias ordenadas determinam a ordem do eixo e adicione cobertura de regressão; concluído significa que o gráfico segue Low, Medium, High em vez da ordem dos dados.

Escrita pelo modelo de indexação a partir do texto da issue.

Avaliação

Stack de tecnologia
pandas, python
Domínio
data-visualization
Tipo de issue
Bug
Dificuldade
3/5
Tempo estimado
1-2 dias
Status de atividade
Estagnada
Clareza
Razoavelmente clara
Facilidade para iniciantes
42/100

Receba novas issues na sua caixa de entrada

Um resumo curto de issues do GitHub para quem está começando.